K-Means 聚类:给岗位实习企业分群

30 家合作企业,横轴是学生从学校过去的单程通勤时长,纵轴是实习月薪。 机器没有标准答案可参考,它靠反复做两件事把企业分成几类:先把每家企业分给最近的中心,再把中心挪到本组的正中间。 点「下一步」一步一步看。

按「下一步」开始。也可以直接点图上任意位置添加一家企业。

教学提示:多按几次「换一组初始中心」。同样的数据、同样的 k,分出来的组可能不一样 —— 这就是 K-Means 会陷入局部最优的原因,也是实际用它时要跑很多次取最好结果的原因。

当前轮次0
组内距离平方和(已归一化)—
本轮有几家换了组—

这个数(也叫 SSE)是把每家企业到本组中心的距离先平方、再全部加起来。 算距离之前,页面已经把通勤按 0 到 80 分钟、月薪按 2500 到 9500 元,各自换算成 0 到 1 之间的比例。 不换算的话,月薪动辄差几百上千,通勤那几十分钟的差别会被完全淹没。所以这里显示的是零点几,不是「多少分钟」也不是「多少元」。

—

这条线是每个 k 各跑 12 次、取最好的一次画的。按最优分法算,k 越大距离平方和不会变大,所以不能只看谁最小,要看每多分一类还能省下多少。 注意:单独跑一次(上面「换一组初始中心」那种)可能停在局部最优,k 变大时 SSE 反而变大也会发生。 本页的实际情况是:1 到 2 省得最多,图上最陡的弯就在 k=2;但 2 到 3、3 到 4 都还在明显下降, 到 5 以后才真正变平。肘部法则不总能给出唯一答案,这份数据分 3 类和 4 类都说得通, 最后要看哪一种分法在业务上讲得通、每一组都能说清是什么样的企业。

组企业数平均月薪平均通勤

数据为教学用合成数据,不含任何真实企业或学生信息。 本页可自由嵌入、修改与再分发(CC BY-NC 4.0)。
来源:AI 教学改革实践研究计划(AFCEC × 实战云)资源包主页