模型怎么学会歧视:藏起来的偏见
AI Explorables · Hidden Bias / Measuring Fairness / Dataset Worldviews · Google PAIR · AI Explorables(2020–2022)
三篇连读:把性别从训练数据里删掉,模型照样能用别的变量拼出它;两个公平性指标为什么不可能同时拉平;换一套标注口径,偏见就跑到别的地方去了。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 从《隐藏的偏见》开始一路向下滚,重点看「把性别藏起来,模型仍能用社团、面试、作品集拼出性别的替代变量」那一段
- 进《测量公平性》,拖三个滑块,确认无论怎么拖,两个公平性指标都无法同时拉平
- 进《数据集自带世界观》,点「运行分类器」,再依次换几种标注口径,看准确率表格里的偏见跑到哪里去了
课堂怎么用
- 《测量公平性》全屏投影,让两个学生分别拖两组滑块,全班一起找「两个指标同时公平」的那一组参数,找不到就是这节课的结论
- 《数据集自带世界观》让每组换一套标注口径跑一遍,把各组的准确率表格并排贴出来,讨论同一个模型同一批数据为什么偏见位置不同
- 和 E-05 几率均等连讲:那件给指标的定义,这三篇给指标为什么会互相打架
思考题
- 把「性别」这一列从训练数据里删掉,模型就公平了吗?它是靠哪些变量拼出性别的?
- 为什么只要两组的基准率不同、检测又不完美,几个公平性指标就不可能同时相等?
- 同一批图片换一套标注口径,「准确率」这个数字还能横向比较吗?
已知限制
- 案例背景是美国语境(大学招生变量、人口普查、司法风险评估),课堂上需要把场景换成本土的说一句
- 《数据集自带世界观》里的标注员界面等插图是位图,图中英文无法翻译,正文与交互界面已是中文
- 原作文末的读者反馈表单在国内不可达,已整块去掉
- 所有数据均为原作生成的模拟数据,不含真实个人信息
原作 AI Explorables · Hidden Bias / Measuring Fairness / Dataset Worldviews(Adam Pearce、Ellen Jiang、Nicole Mitchell、Dylan Baker、Nithum Thain、Jasper Snoek、Mahima Pushkarna 等(Google PAIR),Google PAIR · AI Explorables(2020–2022)),Apache-2.0 许可(原文),界面已中文化。