AI 教学改革实践研究计划AI 教改实践研究计划 全国高等院校计算机基础教育研究会 ×实战云


AI 课件库 › 可信 AI › 隐私保护

隐私保护三讲:随机化回答、模型泄露与联邦学习

AI Explorables · Collecting Sensitive Information / Data Leak / Federated Learning · Google PAIR · AI Explorables(2020–2022)

三篇连读:怎么在每个人都有合理推诿空间的前提下统计出真实比例;训练数据怎么被从模型里反推出来;以及「原始数据不出设备」到底保住了什么、没保住什么。

适用
数据安全与隐私保护、AI 伦理、人工智能导论、大数据技术专业导论
概念
随机化回答、差分隐私、去标识化、模型反演攻击、成员推断、联邦学习、安全聚合
课时
进阶 · 建议 45 分钟
网络
离线可用(不依赖外网,需能打开本站)

全屏打开实验 ↗ 原作源代码 ↗

交互实验(可直接投屏)

原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。

动手三步

  1. 从《收集敏感信息》开始:拖人数和正面概率两个滑块,点掷硬币,看估计值和真实比例的误差分布
  2. 进《为什么有些模型会泄露数据》:拖动数据点看模型实时变化,再往下看从拟合直线反推个体数值那一段
  3. 进《联邦学习如何保护隐私》:把消息标成垃圾信息,点「合并模型」跑一轮联邦训练,最后在试验场里扫一遍变量组合

课堂怎么用

  • 《收集敏感信息》可以在课堂上用真硬币实做一遍随机化回答(问一个无伤大雅的问题),再回到页面上对比估计误差
  • 用《数据泄露》讲清一件事:模型是训练数据的一种压缩,压得越狠越安全,压得越松越准确
  • 联邦学习那篇末尾追问「服务器还能从上传的本地模型里推断出什么」,引出安全聚合与差分隐私各挡住哪一层
  • 和 B2 提示词红线开课包连讲:那件讲「什么不能贴给 AI」,这三篇讲「为什么删了名字也不等于安全」

思考题

  1. 随机化回答为什么能在「每个人都有合理推诿空间」的同时,还让整体比例可以被估计出来?代价是什么?
  2. 模型本身不存原始数据,为什么还会泄露训练数据?
  3. 联邦学习说「原始数据不出设备」,那服务器还能推断出什么?

已知限制

  • 案例背景是美国语境(大学招生变量、人口普查、司法风险评估),课堂上需要把场景换成本土的说一句
  • 原作文末的读者反馈表单在国内不可达,已整块去掉
  • 所有数据均为原作生成的模拟数据,不含真实个人信息
  • 本组内容讲的是隐私保护的原理,不构成任何合规意见;具体做法以本校规定为准

原作 AI Explorables · Collecting Sensitive Information / Data Leak / Federated Learning(Adam Pearce、Ellen Jiang、Nicole Mitchell、Dylan Baker、Nithum Thain、Jasper Snoek、Mahima Pushkarna 等(Google PAIR),Google PAIR · AI Explorables(2020–2022)),Apache-2.0 许可(原文),界面已中文化。

← 几率均等:怎么衡量模型对不同人群是否公平 联邦学习游乐场:数据不出本地,模型怎么一起训 →

使用与数据说明 · 来源与许可