AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 大模型与生成式 AI › 大模型原理

动画版大模型原理

AnimatedLLM · 教学网站,2025(无配套论文)

把大模型「生成一句话」和「训练一步」拆成一帧一帧的动画:词元怎么切、向量怎么走、概率怎么出、猜错了怎么改。原作自带中文界面与中文示例。

适用
人工智能导论、自然语言处理、深度学习、生成式 AI 应用
概念
词元化、词嵌入、位置编码、注意力、前馈层、输出概率、温度、反向传播
课时
入门 · 建议 30 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 首页点「文本生成基础」,在输入框左侧换例句(「你是谁?」「中国的首都是」「“谢谢”里有多少个“谢”字?」),按空格播放,按 → 一步步走
  2. 点输入框右侧的设置图标,换模型和温度(0.0 / 1.0 / 5.0),同一句话再播一遍,比较候选词概率
  3. 回首页进「Transformer 如何生成文本?」,右侧八个阶段跟着动画逐个亮起:词元化 → 输入嵌入 → 位置嵌入 → 注意力层 → 前馈层 → 最后的隐藏状态 → 输出概率 → 下一个词元
  4. 进「训练基础」,选一篇中文文档,看模型每猜一个词元就和真实答案比一次,读「模型误差」怎么变

课堂怎么用

  • 用「“谢谢”里有多少个“谢”字?」讲分词:模型看到的不是汉字而是词元,数不清字数是结构决定的,不是「笨」
  • 温度 0.0 / 1.0 / 5.0 连播三遍,让学生自己总结温度改了什么——改的是概率分布,模型参数一个没动
  • 「训练基础」里先让学生自己猜下一个词元,再揭晓模型的概率和误差,把「训练 = 不断修正预测」讲实
  • 和 B-03 循环神经网络对照:那件是一个词一个词读,这件是一个词一个词写

思考题

  1. 同一个提示词,温度 0.0 和 5.0 生成的句子不一样,模型本身变了吗?
  2. 「输出概率」这一步给了几万个候选词,模型是怎么从中挑一个的?
  3. 训练时的误差写成 −log(p),概率 0.9 和 0.1 对应的误差差多少?为什么要取对数?

已知限制

  • 原作自己声明:除英语和捷克语外,界面翻译由大模型自动生成,个别措辞偏生硬
  • 本站只上中英两种语言,原作的捷克语、法语、乌克兰语示例数据未镜像,语言切换器已相应只列中英
  • 动画是真实模型跑出来的「录像」,播放时浏览器里并没有在跑模型,换不了自己的提示词
  • 「使用说明」页原本内嵌的视频大陆打不开,已换成文字说明;页内指向外部文章与模型页的链接在教室网络下多半打不开
  • 「速查表」PDF 只有英文版
  • 1366 宽下 Transformer 视图右侧会被切掉一点,投影建议缩放到 90%

原作 AnimatedLLM(Zdeněk Kasner(捷克查理大学 ÚFAL 形式与应用语言学研究所),教学网站,2025(无配套论文)),MIT 许可(原文),界面已中文化。

← 分词器实验台 大模型三维可视化 →

使用与数据说明 · 来源与许可