AI 课件库 › 大模型与生成式 AI › 大模型原理
大模型是怎么「想」的
从分词、注意力到逐字生成,用一句中文看完全过程
为什么做这个包
老师被学生问得最多的一句是「它到底懂不懂」。这个包不讲 Transformer 架构图,只讲三件事:它把话切成了什么、它在看哪几个字、它为什么选了这个字。演示页是教学简化模拟,页面上如实标注,不冒充真实模型输出。
交互演示(可直接投屏)
包里有什么
教案
本教案配套「大模型是怎么『想』的」资源包,面向全校各专业的 AI 通识课与学科融合课,不需要数学与编程基础。
这节课要解决的是学生问得最多、老师最难三言两语讲清的那个问题:它到底懂不懂。
一、这节课要让学生带走什么
学完这节课,学生应当能做到三件事:说清大模型处理一句话的三个环节;解释为什么同一个问题问两次答案可能不一样;判断什么场景下不能把大模型的回答直接当结论。
不要求学生理解 Transformer 结构,不出现矩阵与向量。
二、先说清一件事:这节课用的是演示,不是实测
演示页顶部有一段黄色提示,请务必念给学生听:页面上的分词、注意力与候选词概率,都是为讲清机制而人工标注的,不是真实模型的输出。
这不是免责声明,它本身就是教学内容。学生今后会大量接触各种「AI 原理动图」,分得清哪些是示意、哪些是实测,是 AI 素养的第一课。真实模型的注意力是几十层、几十个头的密集数值,人眼读不出故事;演示页把它简化到能讲的程度,代价是失去了真实性,这个代价要讲明白。
三、学情与易错点
| 误解 | 学生会怎么说 | 怎么破 |
|---|---|---|
| 以为它在查数据库 | 「它是不是把答案搜出来了」 | 演示第三页:它一次只写一个词,没有完整答案可查 |
| 以为注意力就是理解 | 「它把『他』看成老师了」 | 演示第二页:注意力说明信息从哪些词汇集,不能由百分比推出它的语义判断 |
| 以为回答稳定 | 「昨天问它明明不是这么说的」 | 温度滑块,当场把同一句话生成两次 |
| 以为它知道自己错了 | 「它怎么会一本正经胡说」 | 逐词元生成本身不保证事实正确;接了检索、工具或核验流程的应用能改善可靠性,但输出仍要看证据 |
四、45 分钟版
| 时间 | 环节 | 老师做什么 | 学生做什么 |
|---|---|---|---|
| 0–5 分 | 开场提问 | 问:你们觉得 AI 回答问题时,是先生成好整段再显示,还是一个词元一个词元地往外写 | 举手表态,记下两边人数 |
| 5–8 分 | 讲清演示的边界 | 念黄色提示,说明示意与实测的区别 | 听 |
| 8–16 分 | 第一页·分词 | 切换三个例句,重点讲「交给」没被拆开 | 猜下一句会被切成几块 |
| 16–28 分 | 第二页·注意力 | 用「小明把作业交给老师,他很满意」,点「他」;再切到第二句,先点「苹果」再点「手机」 | 先自己判断「他」指谁,再看示意权重,讨论「权重高能不能说明它这样理解」 |
| 28–38 分 | 第三页·生成 | 单步生成,调温度,同一句连生成两次;再让学生点一个不是最高的候选词 | 观察两次结果是否相同,以及换一个词之后后面怎么变 |
| 38–45 分 | 回到开场问题 | 揭晓:它是逐词元生成的(这是可观察的机制,不等于人的「思考过程」)。讨论这意味着什么 | 说出至少两条使用注意事项 |
五、90 分钟版
前 45 分钟同上。后 45 分钟做两件事。
第 46 到 70 分钟,按实验手册完成「核验一次 AI 的回答」任务:学生用自己常用的 AI 工具,就本专业的一个具体问题提问,记录回答,再逐条核实事实。查到错误、全部正确、证据不足、AI 拒答都是有效结果,评分看证据质量。这个任务不需要编程,但要求学生查证,是本节课的落点。
第 71 到 90 分钟,分组汇报核实结果,按评价量规互评。教师收尾时把学生的核验结果归类(查到错误、全部核验正确、证据不足、AI 拒答),指出:逐词元生成本身不保证事实正确,所以无论这次结果如何,涉及具体事实的都要看证据。
六、提问脚本
第一页切到第二句时问:「苹果」这两个字,编号和水果的苹果是同一个吗。答案是同一个。追问:那它怎么知道这里说的是公司。留到第二页揭晓。
第二页切到这一句时,先点「苹果」:它是句子的第一个词,前面没有别的词,只能看它自己,所以条形只有它自己一根。这里要说明白一件事 —— 模型是从左往右读的,读到「苹果」的那一刻,它还看不见后面的「发布」和「手机」,所以这时它分不出水果还是公司。再点「手机」,它从「苹果」「发布」汇集信息,后面的词把前面的词带进来一起算。这也解释了为什么整页的注意力条里永远不会出现排在后面的词。
第二页点「他」之前先问:你们觉得「他」指谁。通常班里会分成两派。这时再点开注意力,让学生看到示意权重在两者之间都有分配。关键追问:权重给「老师」更多,能不能说明模型「认定」他是老师。答案是不能 —— 注意力只说明信息从哪里汇集,不是指代判断;真实模型有几十层、几十个头,研究也表明注意力权重不能直接当作解释。
第三页调温度前问:为什么有人说 AI 每次回答都不一样,有人说它每次都一样。把温度拉到最左和最右各生成一次。
然后做一次对照:按「重来」,这次不用按钮抽签,直接点候选列表里一个不是最高的词(比如第二句第一步点「要求」而不是「先」),下一步的候选会当场换成另一批,整句话跟着走到另一个方向。这就是「把刚写的词也当成输入」的意思。页面上那段琥珀色小字要一并念给学生:候选词和概率是预先标好的示意,真实模型每写一个词都要把前面整段重读一遍,再从几万个词里重算。
收尾必问:在我们看到的这三个环节里,哪一个环节是在核对「这句话是不是真的」。答案是这三个环节里没有。所以语言生成本身不保证事实正确;有的应用会另外接检索、工具或核验步骤来改善可靠性,但即便如此,输出仍要对照证据检查。这是这节课最重要的一句话。
七、板书要点
三行,全程保留:
切成词元。分配注意力。一次写一个词。
下面补一行结论:生成本身不保证事实正确,涉及事实就要看证据。
八、与课程思政的结合
本节课天然可接入两个议题:一是学术诚信,学生用 AI 写作业时,AI 并不知道自己在编造;二是信息甄别,面对任何 AI 生成的内容,核实的责任在使用者。建议用第 90 分钟的最后三分钟落到这两点,不要单独加一节课。
九、教师自查
上课前请自己把三页都点一遍,特别是第三页的温度滑块。演示页在线打开即可,请在教室电脑上确认校园网能正常加载(AI 课件库只提供在线使用)。
课件
一个问题,先举手
- AI 回答问题时,是先生成好整段再显示?
- 还是一个词元一个词元往外写?
- 记下两边的人数,下课前揭晓
不要提前公布答案,这个悬念撑起整节课。
先说清楚:这是示意,不是实测
- 演示页的数值是人工标注的
- 真实模型的数值人眼读不出故事
- 分得清示意与实测,本身就是 AI 素养
务必念一遍演示页顶部的黄色提示。
第一步:它读到的不是字
- 句子先被切成一块块「词元」
- 每个词元换成一个编号
- 常见搭配会被切成一整块
打开演示页第一页,切三个例句。
同样两个字,同一个编号
- 「苹果很甜」的苹果
- 「苹果发布手机」的苹果
- 编号一模一样
- 那它怎么区分?
留悬念,第二步揭晓。
第二步:它从哪些词里汇集信息
- 模型从左往右读,每个词只能看它自己和前面的词
- 给这些词各分一个权重(注意力)
- 权重高 = 从那个词汇集的信息多,不等于「理解」
演示第二页:先点「苹果」—— 它是第一个词,只能看自己,这时还分不出水果还是公司;再点「手机」,看它从「苹果」和「发布」汇集信息。
「他」到底指谁
- 小明把作业交给老师,他很满意
- 示意权重:老师 52%,小明 24%,他自己 10%
- 能不能说「模型认定他是老师」?不能
- 注意力说明信息从哪来,不是指代判断
先让学生表态,再点开看。演示数值是人工示意,非模型实测。
第三步:一次只写一个词
- 不会一次想好整句
- 每次只算「下一个词最可能是什么」
- 写下来,再把它当输入,算下一个
演示第三页,单步生成。让学生点一个不是最高的候选词,看后面的候选立刻换了一批。
温度:为什么同一个问题答案会变
- 温度低:几乎总选概率最高的词
- 温度高:几个候选被拉平,可能选到后面的
- 同一句连生成两次,当场对比
把滑块拉到最左和最右各跑一次。
回到开场那个问题
- 它是逐词元生成的
- 每一步算「下一个词元的概率」,再选一个写下
- 这是可观察的机制,不等于人的「思考过程」
公布开场投票的答案。
最重要的一句
- 这三个环节里,哪一步在核对「这是不是真的」?
- 这三步里没有
- 所以生成本身不保证事实正确
- 接了检索或工具的应用能改善,但仍要看证据
板书最后一行写在这里。
实验手册
本实验不需要编程,约需 25 分钟,可在课堂后半段完成,也可作为课后作业。目标是让学生亲手核验一次 AI 的回答:结论可能是查到错误、全部核验正确、证据不足或 AI 拒答,四种都是有效结果。评分看核验过程是否可复核、结论是否与记录一致,不看有没有「抓到 AI 出错」。
一、准备
任何一个学生能用的 AI 对话工具都可以。手机或电脑均可。需要能上网查证。
二、任务:核验一次 AI 的回答
第一步:挑一个你查得动的问题(5 分钟)
在本专业范围内,想一个满足三个条件的问题:有确定答案、答案能在权威来源查到、不是常识。
好问题的例子:某个国家标准的最新版本号是什么。某本教材第几章讲的是什么内容。某个行业规范对某项指标的具体数值要求是多少。
不好的例子:什么是人工智能(没有唯一答案)。今天天气怎么样(AI 本来就不知道)。
第二步:问 AI,原样记录(5 分钟)
把问题发给 AI,把回答完整复制下来,不要改写、不要只记大意。同时记下工具或模型名称、日期、是否联网。特别注意回答里有没有具体的数字、标准号、条款号、书名、页码、人名、年份。
第三步:逐条核实(10 分钟)
把回答里的内容先分成三类:事实(数字、标准号、书名、年份等)、推断、建议。把需要核实的事实逐条去查,查证来源要写明:官方网站、教材原文、国家标准全文公开系统等。
用下面这张表记录:
| 回答里的说法 | 类型(事实/推断/建议) | 核验结果(属实/有误/证据不足) | 我查的来源 |
|---|---|---|---|
第四步:再问一次(5 分钟)
把完全相同的问题重新发一遍,最好新开一个对话。对比两次回答是否一致。如果不一致,记下差在哪。
第五步(选做):给资料再问一次(5 分钟)
把你在第三步查到的权威资料原文贴给 AI,要求它只依据这段资料回答同一个问题,并标出依据的原句。对照:回答、它标的引用、资料原文三者是否一致。两种条件下都可能答对,也都可能出错,如实记录即可,不要预设结果。
三、要回答的三个问题
第一,你的核验结论是什么:查到错误、全部核验正确、证据不足,还是 AI 拒答。如果查到错误,错的是哪一类信息(数字、名称、年份、来源);如果全部正确或证据不足,写清你是怎么确认的、还缺什么证据。
第二,两次回答一致吗。结合课上讲的温度,解释为什么。
第三,AI 在给出那个错误答案时,语气上有没有表现出不确定。这一条通常最让学生印象深刻。
四、预期结果
不少学生会在涉及具体编号、年份、条款、页码的信息上查到错误,且 AI 的语气与正确回答时往往没有区别;也会有学生核验后全部正确,或找不到足够的权威来源。这正是本节课要落到的点:生成本身不保证事实正确,所以说错和说对时的「自信程度」可能一样。
如果全班都没查到错误,不必追着换问题找错 —— 如实的「全部正确」同样是好结果。若课堂时间允许,教师可提供一个备用问题做对照:让 AI 说出某本专业教材某一章的具体小节标题。
五、常见问题
| 现象 | 说明 |
|---|---|
| AI 说「我不确定」或拒绝回答 | 这是一种有效结果,如实记录。有时间可以换一个问题再做一次 |
| 两次回答完全一样 | 该工具可能把温度设得很低。这不影响结论,在第二问里如实写 |
| AI 给出了参考链接 | 一定要点开核实。编造链接是常见的一类幻觉 |
| 学生找不到权威来源 | 查证能力本身是这个实验的一半价值,教师可现场示范一次 |
六、提交什么
提交一页纸:你的问题、工具与日期、AI 的完整回答、核验表、三个问题的回答。评分依据见配套的评价量规。
七、给教师的提醒
这个实验会让一部分学生对 AI 产生过度否定。收尾时要平衡:生成本身不保证事实正确,所以凡是涉及具体事实的必须看证据;但在归纳、改写、提供思路这些不依赖事实准确性的任务上,它仍然很有用。这节课的目的是学会分辨,不是劝退。
习题与答案
本习题配套「大模型是怎么『想』的」资源包,不涉及数学与编程,适合全校各专业。每题后附评分要点。
一、概念题
1. 用不超过 60 字说明大模型处理一句话的三个环节。
评分要点:切成词元、用注意力从上下文汇集信息、一次写一个词元。三层齐全给满分,缺一层扣三分之一。把注意力说成「理解」或「判断含义」的,这一层只给一半。
2. 「苹果很甜」和「苹果发布了新手机」,这两个「苹果」在模型眼里的编号是否相同?它靠什么区分含义?
评分要点:编号相同。靠上下文:模型从左往右读,读到「苹果」时它还分不出来;等读到后面的「甜」或者「手机」,这些词把「苹果」带进来一起算,所处上下文不同,得到的表示也就不同。答成「注意力决定了含义」的不扣分,但教师应补一句:权重说明信息从哪来,不等于模型的语义判断。演示页下拉框里两句都有,可现场对照。
3. 为什么同一个问题问两次,AI 的回答可能不一样?
评分要点:每一步是在若干候选词里按概率选一个,不是永远选概率最高的。温度越高,选到后面候选的可能性越大。
二、判断与说明
4. 判断下面三句话的对错,并各用一句话说明理由。
第一句:AI 回答问题时,是先把整句话想好再输出的。
第二句:AI 说得很肯定的时候,说明它比较有把握。
第三句:AI 给出的参考文献一定是真实存在的。
评分要点:三句全错。理由分别是:它逐个词元生成,不是先把整句想好;语气与事实正确性无关,生成本身不保证正确;编造文献与链接是常见的一类幻觉。对第二句,若学生补充「接了检索或核验的应用可靠性会提高,但仍要看证据」,给附加分。
5. 有同学说:「AI 会胡说,是因为训练数据里有错误信息。」这个解释完整吗?
评分要点:不完整。训练数据有噪声是一个原因,但更根本的是生成本身不保证事实正确 —— 即使训练数据全对,逐词元生成时仍可能组合出没有出现过的错误说法。能指出「生成机制本身不保证正确」即可给满分;进一步指出「检索、工具或核验步骤可以改善,但不能免去查证」的给附加分。
三、应用题
6. 下面是某学生用 AI 写的实训报告片段。请指出其中哪些内容必须自己核实,哪些可以直接采用。
本次实训采用 GB/T 19001—2016 标准第 7.5 条的要求,对三批样品进行检测。检测方法参考《质量管理体系基础》第四章。实训过程中我们发现,样品的一致性明显优于预期,这可能与前处理环节的温度控制有关。
评分要点:这段里没有一句可以直接采用。
必须外部查证的是标准号、年份、条款号、书名与章节号 —— 全是具体事实。最后一句「我们发现样品的一致性明显优于预期」看着像观察结论,其实同样是 AI 接出来的:它不在实训现场,没见过学生的样品,这句话必须拿自己的实测数据核对,对不上就得删掉重写。能把片段分成三类即为掌握:需要外部查证的事实、需要用自己的实验记录核对的「我们发现」、以及在核对之后才轮到学生自己负责的分析与推测。
备课提示(GB/T 19001—2016 条款):这处引用是片段里一处货真价实、学生查得到的错误。GB/T 19001—2016《质量管理体系 要求》(等同采用 ISO 9001:2015,2016-12-30 发布、2017-07-01 实施,现行有效)第 7.5 条是「成文信息」,下设 7.5.1 总则、7.5.2 创建和更新、7.5.3 成文信息的控制,讲的是文件与记录的管理,与「对三批样品进行检测」无关。与检测、测量真正相关的是第 7.1.5 条「监视和测量资源」(7.1.5.1 总则、7.1.5.2 测量溯源);产品放行在 8.6,不合格输出的控制在 8.7。学生若指出「7.5 条是成文信息,跟检测样品对不上」,属满分表现,请按对处理。
7. 你的老师要求「不许用 AI 写作业」。结合这节课学到的机制,说说你认为这条规定的合理之处与不合理之处。
评分要点:开放题。合理方向:涉及事实的部分若不核实会出错,且学生无法为自己不理解的内容负责。不合理方向:用于查资料、改语句、提供思路并不等于代写。关键看是否用本节课的机制解释,而不是泛泛而谈。禁止只表态不说理。
8.(实践)完成实验手册的「核验一次 AI 的回答」任务,写出你的核验结论(查到错误 / 全部核验正确 / 证据不足 / AI 拒答)和核验过程。
评分要点(100 分,按证据质量给分,不按是否查到错误给分):问题与记录 20 分(问题、工具或模型、日期、联网状态、完整回答);事实拆分 20 分(区分事实、推断与建议,提取需核实的主张);查证过程 40 分(可访问的权威来源,逐项对应主张);结论与边界 20 分(结论与记录一致,承认不确定性,不选择性报告)。「查到错误」和「全部核验正确」两种结论,证据同样扎实即可得同样的高分;证据不足时如实写明、不硬下结论,同样可得高分。只写「我发现它说错了」而无来源的,查证过程不给分。
评价量规
本量规用于「大模型是怎么『想』的」实验与讨论环节的过程性评价。可直接用于课堂互评,也可作为 AI 教改课题的过程性评价证据留存。
四个维度各 25 分,合计 100 分。建议教师评与学生互评各占一半。
维度一:机制理解(25 分)
| 等级 | 分值 | 表现描述 |
|---|---|---|
| 优秀 | 22–25 | 能用自己的语言说清三个环节,指出生成本身不保证事实正确,并能区分基础生成与接了检索、工具的应用 |
| 良好 | 17–21 | 能说清三个环节,需提示才能联系到幻觉 |
| 合格 | 13–16 | 能复述环节名称,解释时有混淆 |
| 待改进 | 0–12 | 仍认为 AI 是在检索已有答案 |
维度二:查证过程(25 分)
| 等级 | 分值 | 表现描述 |
|---|---|---|
| 优秀 | 22–25 | 逐条拆出事实性信息并注明权威来源,来源可复核 |
| 良好 | 17–21 | 核实了主要信息,来源标注不够具体 |
| 合格 | 13–16 | 做了核实,但只查了一两条或来源不权威 |
| 待改进 | 0–12 | 未实际查证,或直接用另一个 AI 来验证前一个 AI |
维度三:结论表达(25 分)
| 等级 | 分值 | 表现描述 |
|---|---|---|
| 优秀 | 22–25 | 用自己的核验记录支撑结论(查到错误、全部正确、证据不足均可),区分开事实性内容与分析性内容,承认不确定性 |
| 良好 | 17–21 | 结论正确,与实测数据的联系不够紧 |
| 合格 | 13–16 | 复述课堂结论,未结合自己的实验 |
| 待改进 | 0–12 | 结论与自己记录的数据相互矛盾,或只报告对结论有利的部分 |
维度四:使用态度(25 分)
| 等级 | 分值 | 表现描述 |
|---|---|---|
| 优秀 | 22–25 | 既能说出必须自己核实的边界,也能说出 AI 确实好用的场景,态度有依据 |
| 良好 | 17–21 | 能说出边界,对可用场景表述笼统 |
| 合格 | 13–16 | 只强调一面(全盘信任或全盘否定),但有一定理由 |
| 待改进 | 0–12 | 无依据的全盘信任或全盘否定 |
用作课题证据时
若本节课用于 AI 教学改革课题的过程性材料,建议留存四样:本量规的评分表原件、学生提交的核实表、课堂投票两次结果的照片或记录、教师的一段教学反思(不少于 200 字,写清学生找到的错误集中在哪一类信息上)。
学生提交的核实表里如含具体人名,留存前请脱敏。
免费在线使用,课堂投屏与嵌入课件请保留出处(CC BY-NC 4.0)。用了或改过这个包,欢迎写信告诉我们效果:aiketi@edu360.cn。