大模型是怎么「想」的
不讲架构图,只讲三件事:它把话切成了什么、它在看哪几个字、它为什么选了这个字。
请先读这一句。本页是教学演示:下面的分词结果、注意力权重与候选词概率,
都是教研人员为讲清机制而人工标注的,不是任何真实模型的输出。真实模型的数值远比这密集、也更难读,
但它的工作方式就是这三步。上课时请把这句话也讲给学生 —— 分辨「示意」与「实测」本身就是 AI 素养的一部分。
它读到的不是「字」,是一块一块的词元
模型不认识汉字,它先把句子切成一个个「词元」,再把每个词元换成一个编号。下面每个方块就是一个词元,方块下的数字是它的编号。
读到一个词时,它从哪些词里汇集信息
点句子里带红框的词,看它把注意力分给了谁。条形越长,表示在计算这个词的表示时,从那个词汇集的信息越多(人工示意,非模型实测)。
模型从左往右读,每个词只能看它自己和它前面的词 —— 所以条形里永远不会出现排在它后面的词。
注意力权重说明「信息从哪里来」,不能直接当成模型对语义的判断或理解。
点上面任意一个词。
它一次只写一个词,写完再回头读一遍
模型不会一次想好整句话。它每次只算「下一个词最可能是什么」,选一个写下来,然后把刚写的也当成输入,再算下一个。
这一页做了简化。每一步的候选词和它们的基础概率都是预先标好的示意,只跟着已经写出来的词分叉;
真实模型每写一个词,都会把前面写过的内容整段重读一遍,再从几万个词里重新算一遍概率。
机制是这个机制,数字不是真实模型的数字。
按「写下一个词」,看它每一步在哪几个候选里挑。