AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 机器学习基础 › 分类

随机森林:为什么一群树比一棵树强

MLU-Explain · Random Forest · 亚马逊机器学习大学(MLU-Explain)

从 1785 年的孔多塞陪审团定理讲起:把若干棵只有六成准确率的树凑在一起多数投票,准确率怎么一路爬上去,以及装袋法和特征抽选为什么必须让树彼此不同。

适用
人工智能导论、机器学习基础、数据挖掘
概念
集成学习、多数投票、孔多塞陪审团定理、装袋法、特征抽选、特征重要性
课时
入门 · 建议 25 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 拖「树的棵数」滑块,再拖「单棵树准确率」滑块,看集成准确率曲线怎么变
  2. 往下看装袋法:同一批数据有放回抽出三份样本集,注意有些点被重复抽中
  3. 看三棵树分别怎么划分,再点路牌让三棵树投票
  4. 滚到九棵树那张图,逐棵悬停,看每棵树的准确率和四个特征的重要性分布

课堂怎么用

  • 先把单棵树准确率拖到 50% 以下,让学生看到「比瞎猜还差的模型越投越糟」,说明定理的前提条件
  • 让每组点一块不同的路牌,记录三棵树各自的决策路径,对比「结论相同但理由不同」
  • 用预测差异网格引出提升法:多数投错时,仍有几棵判对

思考题

  1. 单棵树准确率只有 40% 时,树越多结果会怎样?为什么?
  2. 每次划分只随机抽一部分特征,看上去是自废武功,为什么反而有用?
  3. 九棵树里有几棵准确率明显偏低,为什么不把它们从森林里剔掉?

已知限制

  • 原作打包代码里有 3 处报错,是原站就有的问题(已与原站逐条比对确认),不影响页面渲染与交互
  • 路牌数据集是为讲解构造的小样本,特征重要性数值只作演示

原作 MLU-Explain · Random Forest(Jenny Yeon、Jared Wilber(亚马逊机器学习大学),亚马逊机器学习大学(MLU-Explain)),CC BY-SA 4.0 (文) + MIT-0 (码) 许可(原文),界面已中文化。中文译文与改编内容采用 CC BY-SA 4.0,保留原作署名并注明改动。

← 决策树:树是怎么做划分的 K-Means 聚类 →

使用与数据说明 · 来源与许可