AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 大模型与生成式 AI › 大模型原理

大模型三维可视化

LLM Visualization · 教学网站 bbycroft.net/llm,2023

把一个真实跑得动的小型 GPT 整个摊开成三维结构,左边逐段解说、右边同步高亮,从词元嵌入一路走到输出概率,每一次加法乘法都点得开。

适用
自然语言处理、深度学习、生成式 AI 应用、大模型原理
概念
词元与词表、词元嵌入、位置嵌入、层归一化、自注意力、多头、因果掩码、残差连接、Softmax、温度采样
课时
进阶 · 建议 45 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 打开后先看左侧目录示意图,它是整个模型的地图:词元嵌入加位置嵌入,经过若干个 Transformer 块,再到线性层与 Softmax
  2. 从总览开始,反复按空格或点继续,右侧三维场景会跟着相机推进到当前讲到的那一块
  3. 逐章点开:嵌入、层归一化、自注意力、投影、多层感知机、Transformer 块、Softmax、输出
  4. 在三维场景里拖动旋转、滚轮缩放;鼠标悬停到任意一个格子,能看到这个数是怎么算出来的、源头在哪几个格子
  5. 点右上角切换到更大的模型,用同一套结构对比真实模型的体量差距

课堂怎么用

  • 讲注意力时最省力的一段:把相机推进到某个头,Q 向量与此前每一列的 K 向量逐个做点积,得分存进注意力矩阵的哪一行,全都看得见
  • 「因果」两个字不用嘴解释:让学生看注意力矩阵右上角为什么永远是空的,自己说出「不能偷看未来」
  • 用模型切换按钮做体量直观课:同样的结构,这个演示模型只有八万多个参数
  • 接 C-11 分词器实验台与 C-09 采样器:形成「切词 → 算概率 → 采样」的完整链条

思考题

  1. 词元嵌入和位置嵌入都是查表查出来的,为什么要把两个向量加起来而不是拼起来?
  2. 自注意力算完点积后要除以一个数再做 Softmax,这一步不做会怎样?
  3. 残差连接那条竖线如果去掉,深层网络训练会遇到什么问题?

已知限制

  • 三维场景里的文字(每一层的名称、方块上的数值标注)是 WebGL 用字体图集直接绘制的,不经过网页文字层,中文化词典打不到,仍是英文;左侧走查正文、目录与全部按钮已中文化
  • 目录示意图里的几个英文单词刻意保留:它们是被分词的英文示例文本本身,下面标的数字就是各自的词元编号,译了就对不上
  • 按原作许可的排除条款,作者个人主页、作者照片、RISC-V 测试集未镜像;首页已换成大模型可视化本体
  • 同仓库里与大模型无关的 CPU 模拟器、视频编解码与流体模拟三个子应用未镜像
  • 演示模型是固定的小型 GPT,不能换数据、不能重新训练;右上角另外几个按钮只切换体量示意
  • 需要 WebGL,老旧投影机可能掉帧

原作 LLM Visualization(Brendan Bycroft,教学网站 bbycroft.net/llm,2023),MIT(有排除条款) 许可(原文),界面已中文化。

← 动画版大模型原理 提示词写作助手 →

使用与数据说明 · 来源与许可