AI 课件库 › 大模型与生成式 AI › 嵌入与检索增强
word2vec 是怎么一步步训出词向量的
wevi: word embedding visual inspector · 密歇根大学个人项目,2015
一份 8 个词的玩具语料,一张三层小网络。点一次「下一步」,能看清一次前向传播怎么点亮神经元、一次反向传播怎么改权重;连点 500 步,词向量散点图上意思相近的词会自己聚到一起。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 默认语料是水果与饮料,竖线左边是上下文词、右边是目标词
- 点一次「下一步」,看输入词被点亮、箭头标出这一条训练样本;再点一次,权重按梯度更新,热力图与散点图同时变
- 连点 500 步,看右下角词向量散点图上两类词各自聚团
- 在预设语料里换成 CBOW 与 Skip-gram 两种结构,对照它们在输入端的区别
- 把隐藏层维度从 5 改成 2 或 8,重新开始,看维度怎么影响结果
课堂怎么用
- 先问学生「词向量是从哪儿来的」,再点下一步演示:它不过是输入层到隐藏层那张权重矩阵的一行
- 用两种结构做对照,让学生自己说出「谁预测谁」
- 让学生自己编一段中文语料贴进训练数据框,训练后看聚类是否符合直觉
- 接 C-10 大模型三维可视化:那件的第一步就是词元嵌入,这件讲嵌入是怎么学出来的
思考题
- 隐藏层只有 5 个单元,为什么说这 5 个数就是这个词的词向量?
- CBOW 和 Skip-gram 在这张网络图上的区别,具体体现在哪一层?
- 为什么要用 PCA 才能把词向量画到平面上?
已知限制
- 页首两个链接指向站外文档与代码仓库,课堂断网时打不开
- 训练语料已换成中文词,玩法与原作完全一致
- 配置框里是 JSON 键名,保留英文;格式填错会在页首红条给出中文提示
- 原作者于 2017 年逝世,仓库不再维护,本镜像按 2015 年的最后状态呈现
原作 wevi: word embedding visual inspector(Xin Rong(密歇根大学),密歇根大学个人项目,2015),MIT 许可(原文),界面已中文化。