随机森林:为什么一群树比一棵树强
MLU-Explain · Random Forest · 亚马逊机器学习大学(MLU-Explain)
从 1785 年的孔多塞陪审团定理讲起:把若干棵只有六成准确率的树凑在一起多数投票,准确率怎么一路爬上去,以及装袋法和特征抽选为什么必须让树彼此不同。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 拖「树的棵数」滑块,再拖「单棵树准确率」滑块,看集成准确率曲线怎么变
- 往下看装袋法:同一批数据有放回抽出三份样本集,注意有些点被重复抽中
- 看三棵树分别怎么划分,再点路牌让三棵树投票
- 滚到九棵树那张图,逐棵悬停,看每棵树的准确率和四个特征的重要性分布
课堂怎么用
- 先把单棵树准确率拖到 50% 以下,让学生看到「比瞎猜还差的模型越投越糟」,说明定理的前提条件
- 让每组点一块不同的路牌,记录三棵树各自的决策路径,对比「结论相同但理由不同」
- 用预测差异网格引出提升法:多数投错时,仍有几棵判对
思考题
- 单棵树准确率只有 40% 时,树越多结果会怎样?为什么?
- 每次划分只随机抽一部分特征,看上去是自废武功,为什么反而有用?
- 九棵树里有几棵准确率明显偏低,为什么不把它们从森林里剔掉?
已知限制
- 原作打包代码里有 3 处报错,是原站就有的问题(已与原站逐条比对确认),不影响页面渲染与交互
- 路牌数据集是为讲解构造的小样本,特征重要性数值只作演示
原作 MLU-Explain · Random Forest(Jenny Yeon、Jared Wilber(亚马逊机器学习大学),亚马逊机器学习大学(MLU-Explain)),CC BY-SA 4.0 (文) + MIT-0 (码) 许可(原文),界面已中文化。中文译文与改编内容采用 CC BY-SA 4.0,保留原作署名并注明改动。