AI 课件库 › 深度学习 › 图像分割与关键点检测
端侧 AI 任务集:分割、关键点与分类
MediaPipe Web Task Demo · Google AI Edge 官方示例站
12 个真跑在浏览器里的 AI 任务:给一张照片做像素级分割、涂一笔就把物体抠出来、标出人脸和手和全身的关键点、认出图里是什么、判断一句话的情感与语种。全部本地推理,不上传任何图片。
交互实验(可直接投屏)
原作是一个完整的网页应用,下面直接嵌入;屏幕小或要投影时,点「全屏打开实验」更清楚。
动手三步
- 默认落在图像分割:看内置人像被分成背景、头发、身体皮肤、面部皮肤、衣物、其它六类,拖不透明度看掩码叠加
- 换成「头发分割」,图例立刻变成两类;再换「人像分割」,看同一张图在不同模型下被切成几类
- 传一张猫狗或风景照,看人像类模型在训练域之外会怎么错
- 进交互式分割,在图里任意物体上涂一笔,模型顺着这一笔把整个物体抠出来
- 进人体姿态,看 33 个关键点连成骨架;把最低检测置信度从 0.5 拉到 0.9,看哪些点先消失
- 进图像分类,看金毛照片的前三名,讲相近类别怎么分掉概率
- 有摄像头的教室:任意视觉任务右上角切「摄像头」,看实时帧率与推理耗时
课堂怎么用
- 同一张人像用三个分割模型各跑一遍,让学生说出每个模型的输出类别数与用途差异
- 训练域实验:给人像分割模型喂猫狗照片,看它把狗脸标成「头发」「衣物」,引出模型适用边界
- 后端对照:同一任务切 CPU 与 GPU,记录推理耗时,讲硬件加速
- 阈值实验:改置信度阈值,观察漏检与误检此消彼长,接 A-09 精确率与召回率
- 隐私话题:全部推理在本地完成,摄像头画面不出浏览器
思考题
- 同一张人像,人像分割只分两类、多类分割分六类,模型结构大体相同,差别主要在哪里?
- 把一张狗的照片交给人像分割模型,它为什么仍然会输出「头发」「衣物」?
- 交互式分割只靠你涂的一笔就能抠出整个物体,它比「点一个像素」多拿到了什么信息?
已知限制
- 12 个任务全部默认走图片模式,不给摄像头权限也能完整上完一节课,每个视觉任务都自带静态示例图;拒绝授权后页面不白屏
- 上游 15 个任务里只镜像了 12 个:目标检测、手势识别、文本向量三类的模型权重查不到任何公开许可声明(权重目录无许可文件、模型卡内无许可字样、权重元数据许可字段为空),整页未镜像、入口已删除
- 因此图像分割没有能分猫狗的通用模型,只有人像类分割
- 已镜像的 20 个权重均为 Apache-2.0,逐条证据(模型卡地址与原话、权重内嵌元数据)见许可原文
- 首次进入某个任务要在本机加载模型(最大 29 MB),状态栏会停几秒,不是卡死
- 图像分类的一千个类别名与声音分类的五百多个类别名来自权重里的标签表,只译了常见课堂场景会命中的部分
- 原作运行时自带的遥测上报已移除
- 声音分类需要麦克风权限或手动上传音频,没有内置示例音频
原作 MediaPipe Web Task Demo(Google AI Edge(MediaPipe 团队),Google AI Edge 官方示例站),Apache-2.0 许可(原文),界面已中文化。