聚类:相似度、簇形状与用途共同决定分组
从 K-means 的分配—更新手算,到层次、DBSCAN、混合模型、选 k、稳定性和业务解释。
1聚类先回答“什么叫相似”定义
同一批用户为何能按消费、品类或地域得到不同分组?
聚类是在没有人工类别答案时,依据事先选定的相似规则把样本分组。它解决的是“数据里是否存在可复用的结构”,而不是替样本发现唯一真实身份。输入是每个对象的特征表示、距离或相似度以及算法参数;输出是簇编号,也可能包含中心、层次树、噪声标记或软归属概率。
特征选择、缩放与距离共同定义邻近。欧氏距离重绝对差,余弦距离重方向,编辑距离重序列变换。算法按这种定义寻找组内较相似、组间较不同的结构。簇编号本身没有大小或天然语义,必须查看代表样本与特征分布后再命名。
边界:如果表示遗漏了任务所需信息,或把设备、地区等混杂当成主要差异,聚类会稳定地给出一个无用甚至有害的分组;算法不能替你选择有意义的语义。
2K-means 最小化簇内平方和目标
为什么中心必然是所属样本的均值?
K-means 解决“怎样用 k 个中心概括数值向量”的问题。输入是 n 个同尺度向量 xᵢ 和预先指定的簇数 k;输出是每个样本的簇编号 cᵢ、每簇中心 μₖ,以及衡量组内紧致程度的目标值 J。
这里 i 是样本编号,xᵢ 是第 i 个向量,cᵢ 是它当前所属的簇,μcᵢ 是该簇中心,‖·‖² 是平方欧氏距离,J 是所有样本到各自中心的平方距离之和。固定中心时,每点选最近中心能独立降低 J;固定归属时,对中心求导并令零,最优中心就是簇内均值。两个步骤交替,J 不增并最终停止。
J 越小只表示样本在当前尺度下离中心更近,不能直接解释为业务分组更好。算法只保证到达局部最优,不保证全局最优;不同初始化可能到不同解,非球形簇或未缩放特征也会使结果失真。
| 点 | 到 μ₁=(1,1) 的平方距离 | 到 μ₂=(8,8) | 归属 |
|---|---|---|---|
| A | 0 | 98 | 1 |
| B | 1 | 85 | 1 |
| C | 1 | 85 | 1 |
| D | 98 | 0 | 2 |
| E | 113 | 1 | 2 |
3完整手算:分配后重新计算两个中心逐步演算
第一次更新会把中心移到哪里,目标下降多少?
这一节把上一节的“分配—更新”规则用于五个已给坐标,目的是看清一次迭代的输入和输出。分配步输入旧中心,比较表中平方距离后输出簇1={A,B,C}、簇2={D,E};更新步再把每簇坐标逐维求平均。
簇1的新中心 μ₁=((1+1+2)/3,(1+2+1)/3)=(4/3,4/3);簇2的新中心 μ₂=((8+9)/2,(8+8)/2)=(8.5,8)。
Jold 是更新前组内平方和,Jnew 是更新后组内平方和;从 3 降到约 1.833,说明新中心对当前分组更紧致。重新分配后归属不变,算法在本例收敛,但这不证明得到全局最优或真实类别。这个漂亮结果来自两个紧致球形团块;若点排成弯月、不同密度或含离群值,均值与欧氏距离会失真。
4原创图:同一批点被不同簇假设观察可视化
球形、密度连通与层次切分分别看到什么?
5K-means 偏好球形、相近方差与相近规模边界
为什么长条簇、不同密度和离群点会误导质心?
平方欧氏距离把远点惩罚得很重,离群点能显著拖动均值;最近质心边界是线性的,难表示弯月和环;大簇可能被拆,小簇可能被吞。标准化只处理尺度,不修复形状假设。
| 问题 | 症状 | 候选方法 |
|---|---|---|
| 离群点 | 中心被拖走 | k-medoids、稳健处理 |
| 弯月/环 | 被直线切开 | DBSCAN、谱聚类 |
| 软边界 | 临界点硬分配 | 高斯混合 |
| 多粒度 | k难固定 | 层次聚类 |
6DBSCAN 用局部密度连接任意形状密度方法
ε 和 minPts 怎样共同定义核心点?
DBSCAN 是密度聚类:它解决弯曲簇和噪声点无法由质心良好表示的问题。输入是样本、距离函数、邻域半径 ε 与最少点数 minPts;输出是若干密度连通簇、边界点和噪声标记。
Nε(x) 表示点 x 的 ε 邻域,y 是候选邻点,d(x,y) 是两点距离,|Nε(x)| 是邻域点数。点数达到 minPts 时 x 是核心点;核心点的邻域相互可达就归为同簇,边界点可被吸收,稀疏点标为噪声。噪声不是“错误数据”,只是当前密度尺度下未归入稠密区域。
它无需预设 k 且能追踪弯曲形状;但不同密度共存时,一个 ε 难兼顾,高维距离趋同也会使邻域失去区分。先画 k-distance 曲线只是启发,不是自动真值;应做 ε×minPts 敏感性与重采样稳定性。
7层次聚类把“如何合并”写进链接规则树状图
single、complete 与 average linkage 为什么会得到不同树?
| 链接 | 簇间距离 | 典型倾向 |
|---|---|---|
| single | 最近点对 | 可追弯曲,但易链化 |
| complete | 最远点对 | 紧致,怕离群 |
| average | 平均点对 | 折中 |
| Ward | 簇内方差增量 | 近似球形 |
树状图保留多个粒度,但一旦贪心合并通常不再拆开;早期错误会传递。切树高度应结合稳定区间和用途,不是找一条视觉上最漂亮的横线。
8高斯混合把硬分组改成后验概率软聚类
位于两簇之间的用户为何可以有60%/40%归属?
EM 的 E 步计算责任度 r,M 步用软权重更新 π、μ、Σ。协方差允许椭圆簇,软归属表达边界不确定性;但成分仍依赖高斯假设,似然会因协方差坍缩而数值异常,需要正则化。
9选择 k 不是让单一曲线替你做决定模型选择
惯性为何总能通过增加 k 下降?
选择 k 解决的是“保留多细的分组才有用”。输入是多个候选 k 的聚类结果、内部指标、稳定性和业务约束;输出是一个主选粒度及需要报告的替代粒度。做法是对每个候选重新训练,再比较指标和重采样一致性。
k=n 时每点自成一簇,K-means 惯性可为0,所以不能选最小值。轮廓系数比较一个样本与本簇的平均距离和与最近其他簇的平均距离:接近 1 表示既紧致又分离,接近 0 表示在边界,负值提示可能分错。肘部、轮廓、Gap、BIC/AIC 都带假设且可能意见不同。应寻找一段结果稳定、可解释且支持行动的粒度,并报告替代 k;内部几何分数不能替代真实业务效果。
| 证据 | 用途 | 局限 |
|---|---|---|
| 肘部 | 边际收益 | 拐点主观 |
| 轮廓 | 紧致与分离 | 偏好凸簇 |
| BIC/AIC | 概率模型复杂度 | 依赖分布族 |
| 业务约束 | 可行动粒度 | 需外部验证 |
10稳定性与语义验证比一次最优分数更重要验收
换随机种子或月份簇就重排,如何判断还能不能用?
- 多初始化,比较目标值与样本共簇矩阵。
- bootstrap/时间切片重训,用 ARI/NMI 或最优匹配比较。
- 查看代表样本、特征分布和边界点。
- 检查设备、地区、缺失模式等混杂。
- 若驱动运营,做对照实验测真实增益与伤害。
簇标签可置换,因此不能直接比较“簇1”名称;应先按样本重叠或质心最优匹配,再判断分裂、合并与漂移。
11常见误区与学习路线误区与依赖
簇是模型产物,命名必须晚于验证。
| 误区 | 更准确的理解 |
|---|---|
| 聚类能找到唯一自然类别 | 分组依赖表示、尺度和假设 |
| K-means每次得到全局最优 | 交替优化只保证局部收敛 |
| DBSCAN无需超参数 | ε和minPts决定密度尺度 |
| 轮廓最高就是最佳k | 内部几何不等于业务价值 |
| 簇编号有固定语义 | 重训后标签可任意置换 |
| 层级 | 依赖与延伸 |
|---|---|
| 先修 | 距离、均值、方差、概率 |
| 本页核心 | K-means、密度、层次、软归属 |
| 诊断 | 降维、维度灾难、异常检测 |
| 治理 | 公平、漂移、人工复核 |
12在线分群还要处理漂移与冷启动生产边界
新用户到来时,是直接分到旧簇,还是立即重新训练?
稳定生产系统通常先用冻结中心或已训练模型给新样本分配,再按时间窗口监控距离、簇规模和未分配率;只有证据表明结构变化时才重训。重训后需匹配旧新簇、审查分裂与合并,并灰度迁移下游策略。频繁重训会让业务标签抖动,永不重训则会把漂移硬塞进过时结构。
13把因果链连起来综合
这个概念怎样从问题一路连接到可验证的实践?
- 定义用途、表示和距离
- 选择与簇形状匹配的算法
- 多初始化并调粒度参数
- 用重采样匹配检查稳定
- 由样本和领域知识解释
- 以下游增益与公平风险决定采用
14误区与自测自测
你能否不用背术语,解释它的机制、边界与验证方法?
- 第一次更新后的两个中心是什么?
- 本例J从多少降到多少?
- DBSCAN的核心点怎样定义?
- single linkage的典型风险?
- 为什么不能直接比较两次运行的“簇1”?
- 假设“聚类:相似度、簇形状与用途共同决定分组”在离线示例上表现正常、上线后核心结果却下降,你会怎样按输入、内部变换、输出反馈和适用边界定位问题?
参考答案
- μ₁=(4/3,4/3),μ₂=(8.5,8)。
- 从3降到11/6≈1.833。
- ε邻域内至少有minPts个点。
- 少量桥接点造成链化。
- 簇编号可任意置换,要先按样本重叠或中心匹配。
- 先保存同一失败样本及环境,确认输入、权限和前置条件没有漂移;再记录关键中间状态,检查机制是否按本页描述完成变换;随后把原始输出与独立指标、人工终验对照;最后用边界样例和对照实验复测。只有定位到首次偏离预期的环节,才能判断应修改数据、机制、评测还是使用边界。
- k-means++: The Advantages of Careful Seeding:初始化与近似保证
- DBSCAN:密度聚类与噪声
- The Elements of Statistical Learning:聚类与混合模型
- Finding Groups in Data:聚类分析与验证