双重下降:过拟合之后还能更好?
MLU-Explain · Double Descent · 亚马逊机器学习大学(MLU-Explain)
经典的 U 形曲线之外还有第二次下降:越过插值阈值之后,参数比数据还多的模型反而越来越好。拖动特征数,亲眼看这条曲线。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 先看经典预期:复杂度再往右,测试误差应当一路飙升
- 往下滚,看四个不同复杂度的模型各自的拟合曲线和误差,注意插值阈值处误差最大
- 拖动「非线性特征数」滑块,从欠参数化一路拖到过参数化,看测试误差的第二次下降
- 看「留意点与点之间」:特征数继续增大时,穿过同样训练点的曲线在点与点之间越来越平滑
课堂怎么用
- 先让学生按上一件(偏差方差权衡)的结论预测最复杂的模型会怎样,再揭晓,制造认知冲突
- 用「所有模型都穿过全部训练点,区别只在怎么连线」讲清插值区间里到底还在变什么
- 联系大模型:参数量远多于样本量为什么还能泛化
思考题
- 什么是插值阈值?越过它之后模型还在学什么?
- 双重下降是否推翻了偏差方差权衡?原文的结论是什么?
- 这个实验用的是随机非线性特征加线性模型,换成真正的神经网络结论还成立吗?
已知限制
- 这是两篇系列的第一篇,第二篇(数学详解)本次未镜像,文中三处链接指向原作站点
- 结论基于作者构造的实验,并非在真实数据集上的普遍结论
原作 MLU-Explain · Double Descent(Jared Wilber、Brent Werness(亚马逊机器学习大学),亚马逊机器学习大学(MLU-Explain)),CC BY-SA 4.0 (文) + MIT-0 (码) 许可(原文),界面已中文化。中文译文与改编内容采用 CC BY-SA 4.0,保留原作署名并注明改动。