AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 机器学习基础 › 模型评估与验证

模型给的百分比是概率吗

AI Explorables · Are Model Predictions Probabilities? · Google PAIR · AI Explorables(2020–2022)

模型说「70% 可能」,一百次里真的会发生七十次吗?拖动阈值和分桶,看校准曲线怎么偏、期望校准误差怎么降。

适用
机器学习基础、人工智能导论、数据分析、可信人工智能
概念
模型校准、期望校准误差、分桶、保序回归、恰当评分规则、置信度
课时
进阶 · 建议 20 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 先读开头:准确率高不等于给出的概率可信
  2. 拖动阈值找最高准确率,再看这时的校准曲线偏到哪里去了
  3. 往下调分桶,看期望校准误差怎么降下来
  4. 读最后一节:校准和其它目标(比如公平性)可能互相冲突

课堂怎么用

  • 先问全班「模型说 70%,你信不信」,再用校准曲线揭晓
  • 和 A-09 精确率与召回率连讲:那件讲判对判错,这件讲「它有多确定」这句话可不可信
  • 联系学生用的大模型:它们输出的「置信度」同样未必校准过

思考题

  1. 准确率很高的模型,给出的概率一定可信吗?
  2. 期望校准误差是怎么算出来的?分桶数为什么会影响它?
  3. 把模型校准好,会不会让准确率变低?

已知限制

  • 案例背景是美国语境(大学招生变量、人口普查、司法风险评估),课堂上需要把场景换成本土的说一句
  • 所有数据均为原作生成的模拟数据
  • 原作文末的读者反馈表单在国内不可达,已整块去掉

原作 AI Explorables · Are Model Predictions Probabilities?(Adam Pearce、Ellen Jiang、Nicole Mitchell、Dylan Baker、Nithum Thain、Jasper Snoek、Mahima Pushkarna 等(Google PAIR),Google PAIR · AI Explorables(2020–2022)),Apache-2.0 许可(原文),界面已中文化。

← 双重下降:过拟合之后还能更好? 感知机 →

使用与数据说明 · 来源与许可