Google PAIR 团队的交互式解读文章,围绕机器学习里的公平、偏见与隐私。本页是为国内课堂制作的中文镜像,只收录其中 7 篇,全部可离线运行。
隐藏的偏见
用真实数据训练的模型会把真实世界的偏见一起学走。把受保护属性藏起来并不总能解决问题,有时反而更糟。
测量公平性
准确率有好几种算法。无论模型怎么建,这些指标落到不同人群身上都会出现差异。
数据集自带世界观
每一个数据集都在表达一种看世界的角度。换一个角度,结论也会跟着变。
随机化回答:如何负责任地收集敏感信息
给每个人发一枚硬币,让他们按掷币结果决定说不说真话。个体答案不可信,总体比例却能还原——这就是随机化回答。
为什么有些模型会泄露数据
模型训练用到大量数据,其中一部分是敏感的。训练方式不当时,这些数据会被无意间泄露出来。
联邦学习如何保护隐私
模型到数据那边去训练,原始数据不出设备。配上安全聚合,服务器连单台设备的更新都看不到。
模型预测是概率吗?
模型用分数表达自己的把握,但分数不等于概率。通过校准,可以把分数变成能用来做决策的概率。