AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 大模型与生成式 AI › 嵌入与检索增强

word2vec 是怎么一步步训出词向量的

wevi: word embedding visual inspector · 密歇根大学个人项目,2015

一份 8 个词的玩具语料,一张三层小网络。点一次「下一步」,能看清一次前向传播怎么点亮神经元、一次反向传播怎么改权重;连点 500 步,词向量散点图上意思相近的词会自己聚到一起。

适用
自然语言处理、人工智能导论、机器学习基础、深度学习
概念
词向量与词嵌入、word2vec、CBOW、Skip-gram、独热编码、隐藏层权重即词向量、前向传播与反向传播、PCA 降维
课时
进阶 · 建议 20 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 默认语料是水果与饮料,竖线左边是上下文词、右边是目标词
  2. 点一次「下一步」,看输入词被点亮、箭头标出这一条训练样本;再点一次,权重按梯度更新,热力图与散点图同时变
  3. 连点 500 步,看右下角词向量散点图上两类词各自聚团
  4. 在预设语料里换成 CBOW 与 Skip-gram 两种结构,对照它们在输入端的区别
  5. 把隐藏层维度从 5 改成 2 或 8,重新开始,看维度怎么影响结果

课堂怎么用

  • 先问学生「词向量是从哪儿来的」,再点下一步演示:它不过是输入层到隐藏层那张权重矩阵的一行
  • 用两种结构做对照,让学生自己说出「谁预测谁」
  • 让学生自己编一段中文语料贴进训练数据框,训练后看聚类是否符合直觉
  • 接 C-10 大模型三维可视化:那件的第一步就是词元嵌入,这件讲嵌入是怎么学出来的

思考题

  1. 隐藏层只有 5 个单元,为什么说这 5 个数就是这个词的词向量?
  2. CBOW 和 Skip-gram 在这张网络图上的区别,具体体现在哪一层?
  3. 为什么要用 PCA 才能把词向量画到平面上?

已知限制

  • 页首两个链接指向站外文档与代码仓库,课堂断网时打不开
  • 训练语料已换成中文词,玩法与原作完全一致
  • 配置框里是 JSON 键名,保留英文;格式填错会在页首红条给出中文提示
  • 原作者于 2017 年逝世,仓库不再维护,本镜像按 2015 年的最后状态呈现

原作 wevi: word embedding visual inspector(Xin Rong(密歇根大学),密歇根大学个人项目,2015),MIT 许可(原文),界面已中文化。

← 采样器怎么挑下一个词 GAN 实验室 →

使用与数据说明 · 来源与许可