AI 课件库 › 大模型与生成式 AI › 大模型原理
大模型三维可视化
LLM Visualization · 教学网站 bbycroft.net/llm,2023
把一个真实跑得动的小型 GPT 整个摊开成三维结构,左边逐段解说、右边同步高亮,从词元嵌入一路走到输出概率,每一次加法乘法都点得开。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 打开后先看左侧目录示意图,它是整个模型的地图:词元嵌入加位置嵌入,经过若干个 Transformer 块,再到线性层与 Softmax
- 从总览开始,反复按空格或点继续,右侧三维场景会跟着相机推进到当前讲到的那一块
- 逐章点开:嵌入、层归一化、自注意力、投影、多层感知机、Transformer 块、Softmax、输出
- 在三维场景里拖动旋转、滚轮缩放;鼠标悬停到任意一个格子,能看到这个数是怎么算出来的、源头在哪几个格子
- 点右上角切换到更大的模型,用同一套结构对比真实模型的体量差距
课堂怎么用
- 讲注意力时最省力的一段:把相机推进到某个头,Q 向量与此前每一列的 K 向量逐个做点积,得分存进注意力矩阵的哪一行,全都看得见
- 「因果」两个字不用嘴解释:让学生看注意力矩阵右上角为什么永远是空的,自己说出「不能偷看未来」
- 用模型切换按钮做体量直观课:同样的结构,这个演示模型只有八万多个参数
- 接 C-11 分词器实验台与 C-09 采样器:形成「切词 → 算概率 → 采样」的完整链条
思考题
- 词元嵌入和位置嵌入都是查表查出来的,为什么要把两个向量加起来而不是拼起来?
- 自注意力算完点积后要除以一个数再做 Softmax,这一步不做会怎样?
- 残差连接那条竖线如果去掉,深层网络训练会遇到什么问题?
已知限制
- 三维场景里的文字(每一层的名称、方块上的数值标注)是 WebGL 用字体图集直接绘制的,不经过网页文字层,中文化词典打不到,仍是英文;左侧走查正文、目录与全部按钮已中文化
- 目录示意图里的几个英文单词刻意保留:它们是被分词的英文示例文本本身,下面标的数字就是各自的词元编号,译了就对不上
- 按原作许可的排除条款,作者个人主页、作者照片、RISC-V 测试集未镜像;首页已换成大模型可视化本体
- 同仓库里与大模型无关的 CPU 模拟器、视频编解码与流体模拟三个子应用未镜像
- 演示模型是固定的小型 GPT,不能换数据、不能重新训练;右上角另外几个按钮只切换体量示意
- 需要 WebGL,老旧投影机可能掉帧
原作 LLM Visualization(Brendan Bycroft,教学网站 bbycroft.net/llm,2023),MIT(有排除条款) 许可(原文),界面已中文化。