AI 课件库 › 大模型与生成式 AI › 大模型原理
动画版大模型原理
AnimatedLLM · 教学网站,2025(无配套论文)
把大模型「生成一句话」和「训练一步」拆成一帧一帧的动画:词元怎么切、向量怎么走、概率怎么出、猜错了怎么改。原作自带中文界面与中文示例。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 首页点「文本生成基础」,在输入框左侧换例句(「你是谁?」「中国的首都是」「“谢谢”里有多少个“谢”字?」),按空格播放,按 → 一步步走
- 点输入框右侧的设置图标,换模型和温度(0.0 / 1.0 / 5.0),同一句话再播一遍,比较候选词概率
- 回首页进「Transformer 如何生成文本?」,右侧八个阶段跟着动画逐个亮起:词元化 → 输入嵌入 → 位置嵌入 → 注意力层 → 前馈层 → 最后的隐藏状态 → 输出概率 → 下一个词元
- 进「训练基础」,选一篇中文文档,看模型每猜一个词元就和真实答案比一次,读「模型误差」怎么变
课堂怎么用
- 用「“谢谢”里有多少个“谢”字?」讲分词:模型看到的不是汉字而是词元,数不清字数是结构决定的,不是「笨」
- 温度 0.0 / 1.0 / 5.0 连播三遍,让学生自己总结温度改了什么——改的是概率分布,模型参数一个没动
- 「训练基础」里先让学生自己猜下一个词元,再揭晓模型的概率和误差,把「训练 = 不断修正预测」讲实
- 和 B-03 循环神经网络对照:那件是一个词一个词读,这件是一个词一个词写
思考题
- 同一个提示词,温度 0.0 和 5.0 生成的句子不一样,模型本身变了吗?
- 「输出概率」这一步给了几万个候选词,模型是怎么从中挑一个的?
- 训练时的误差写成 −log(p),概率 0.9 和 0.1 对应的误差差多少?为什么要取对数?
已知限制
- 原作自己声明:除英语和捷克语外,界面翻译由大模型自动生成,个别措辞偏生硬
- 本站只上中英两种语言,原作的捷克语、法语、乌克兰语示例数据未镜像,语言切换器已相应只列中英
- 动画是真实模型跑出来的「录像」,播放时浏览器里并没有在跑模型,换不了自己的提示词
- 「使用说明」页原本内嵌的视频大陆打不开,已换成文字说明;页内指向外部文章与模型页的链接在教室网络下多半打不开
- 「速查表」PDF 只有英文版
- 1366 宽下 Transformer 视图右侧会被切掉一点,投影建议缩放到 90%
原作 AnimatedLLM(Zdeněk Kasner(捷克查理大学 ÚFAL 形式与应用语言学研究所),教学网站,2025(无配套论文)),MIT 许可(原文),界面已中文化。