AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 机器学习基础 › 模型评估与验证

双重下降:过拟合之后还能更好?

MLU-Explain · Double Descent · 亚马逊机器学习大学(MLU-Explain)

经典的 U 形曲线之外还有第二次下降:越过插值阈值之后,参数比数据还多的模型反而越来越好。拖动特征数,亲眼看这条曲线。

适用
机器学习基础、深度学习、统计学习、人工智能前沿专题
概念
双重下降、插值阈值、过参数化、泛化、平均绝对误差
课时
进阶 · 建议 20 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 先看经典预期:复杂度再往右,测试误差应当一路飙升
  2. 往下滚,看四个不同复杂度的模型各自的拟合曲线和误差,注意插值阈值处误差最大
  3. 拖动「非线性特征数」滑块,从欠参数化一路拖到过参数化,看测试误差的第二次下降
  4. 看「留意点与点之间」:特征数继续增大时,穿过同样训练点的曲线在点与点之间越来越平滑

课堂怎么用

  • 先让学生按上一件(偏差方差权衡)的结论预测最复杂的模型会怎样,再揭晓,制造认知冲突
  • 用「所有模型都穿过全部训练点,区别只在怎么连线」讲清插值区间里到底还在变什么
  • 联系大模型:参数量远多于样本量为什么还能泛化

思考题

  1. 什么是插值阈值?越过它之后模型还在学什么?
  2. 双重下降是否推翻了偏差方差权衡?原文的结论是什么?
  3. 这个实验用的是随机非线性特征加线性模型,换成真正的神经网络结论还成立吗?

已知限制

  • 这是两篇系列的第一篇,第二篇(数学详解)本次未镜像,文中三处链接指向原作站点
  • 结论基于作者构造的实验,并非在真实数据集上的普遍结论

原作 MLU-Explain · Double Descent(Jared Wilber、Brent Werness(亚马逊机器学习大学),亚马逊机器学习大学(MLU-Explain)),CC BY-SA 4.0 (文) + MIT-0 (码) 许可(原文),界面已中文化。中文译文与改编内容采用 CC BY-SA 4.0,保留原作署名并注明改动。

← 偏差方差权衡 模型给的百分比是概率吗 →

使用与数据说明 · 来源与许可