聚类分析
方法概述
聚类分析是一种无监督学习方法,用于发现数据中存在的自然分组,使同一组内的样本彼此相似、不同组之间的样本差异明显。本工具提供 K-means 聚类与层次聚类两种方法,支持对数值变量进行标准化,并输出聚类散点图、K-means 肘部图、层次聚类树状图、各类样本量与簇中心信息,可辅助进行用户分群、市场细分、异常识别等分析。工具内置 AI 智能分析,可解读各类簇的特征差异并给出建议。
计算步骤
1. 数据加载与预处理
- 文件读取:支持 CSV 和 Excel 格式,自动识别常用缺失值占位符并转换为
NA。 - 样本清洗:自动剔除含缺失值的样本行;有效样本数需大于聚类数 \(k\)。
- 变量选择:从数值型变量中勾选参与聚类的变量(至少 1 个)。
2. 数据标准化
默认将每个变量标准化为 Z-score: \[z_i = \frac{x_i - \bar{x}}{\sigma}\] 消除量纲影响,避免量纲大的变量主导距离计算;也可取消标准化以保留原始尺度。
3. 聚类方法
K-means 聚类
将样本划分为 \(k\) 个簇,以组内平方和(WSS)为目标,通过多次随机起始(nstart=20)迭代优化: \[WSS = \sum_{k}\sum_{x \in C_k} \|x - \mu_k\|^2\] 其中 \(\mu_k\) 为第 \(k\) 簇的中心,最终使 WSS 尽量小。层次聚类
先计算样本间距离矩阵,再按连接法逐步合并最近的两类(自底向上)。工具支持以下距离度量与连接方法:- 距离度量:欧氏距离 \(d(x,y)=\sqrt{\sum_i (x_i-y_i)^2}\)、曼哈顿距离 \(d(x,y)=\sum_i |x_i-y_i|\)、最大距离、闵可夫斯基距离。
- 连接方法:最近邻(single)、最远邻(complete)、平均法(average)、Ward 法。
- 按设定 \(k\) 对树状图进行剪切,得到每个样本的簇标签。
4. 结果输出与可视化
- 聚类结果散点图:以参与聚类的前两个变量为横纵轴,按簇着色展示样本分布(仅一个变量时以样本序号为纵轴)。
- 肘部图(K-means):展示不同 \(k\) 值下 WSS 的变化趋势,供确定聚类数参考。
- 树状图(层次聚类):展示样本逐步合并的层次结构,并用红框标出 \(k\) 个簇。
- 各类样本量:各簇的样本数量表。
- 簇中心(K-means):按原始尺度输出各簇中心值;层次聚类不输出簇中心。
5. AI 智能分析
基于聚类摘要(方法、参与变量、有效样本数、标准化情况、各类样本量等),调用大语言模型解读各簇特征差异并评估聚类数是否合适(每日限 3 次,需配置 API 密钥)。
6. 结果导出
支持下载聚类结果数据(CSV/Excel)及包含各类样本量与结果预览的 HTML 报告。
案例分析
案例背景:某连锁门店希望按近 3 个月消费特征对 10 名会员进行分群,以便制定差异化运营策略。
输入数据(示例):
| 会员ID | 消费金额(元) | 到店次数 |
|---|---|---|
| M01 | 4200 | 16 |
| M02 | 850 | 3 |
| M03 | 6800 | 22 |
| M04 | 1500 | 5 |
| M05 | 3200 | 11 |
| … | … | … |
处理过程:
- 数据加载:上传 CSV,勾选”消费金额、到店次数”两个变量参与聚类。
- 参数设置:选择 K-means 方法,聚类数 \(k=3\),标准化开启,随机种子 123,肘部图最大 \(k=6\)。
- 聚类结果(示例):
- 各类样本量:
| 簇 | 样本量 |
|---|---|
| 1 | 4 |
| 2 | 3 |
| 3 | 3 |
- 簇中心(原始尺度,示例值):
| 簇 | 消费金额(元) | 到店次数 |
|---|---|---|
| 1 | 5250 | 18 |
| 2 | 2600 | 9 |
| 3 | 980 | 4 |
- 解读:示例数据下,簇 1 为高消费高频次会员、簇 3 为低消费低频次会员、簇 2 居中;肘部图显示 \(k=3\) 后 WSS 下降趋缓,与设定值一致。
- 结果导出:下载含”Cluster”列的结果数据用于后续运营。
结论:在本示例数据上,3 个簇区分了高中低三档消费人群,可用于差异化运营。该结论仅针对示例数据,正式分群应结合更多样本和业务验证。
常见问题
Q1: 如何确定合适的聚类数 k?
A: 可参考 K-means 肘部图(WSS 随 \(k\) 变化趋于平缓处)和各类样本量分布,但该结果为参考值,最终需结合业务可解释性确定;层次聚类可观察树状图结构辅助判断。
Q2: K-means 和层次聚类如何选择?
A: K-means 计算速度快,适合样本量较大、簇形较规则的数据;层次聚类给出完整的树状结构,适合样本量较小或需观察嵌套结构的数据。
Q3: 需要标准化吗?
A: 各变量量纲差异较大时建议开启标准化(默认开启),避免量纲大的变量主导距离;各变量尺度一致时可取消。
Q4: 为什么两次运行结果可能略有不同?
A: K-means 依赖随机初始中心。工具通过多次随机起始并固定随机种子来提升稳定性并使结果可复现;建议保持种子一致以便对比。
Q5: 聚类结果是唯一确定的分组吗?
A: 不是。不同方法、不同 \(k\) 值、是否标准化都会产生不同分组,聚类结果需结合业务背景评估其合理性。
平台功能
- 数据输入:支持 CSV、Excel 格式,自动识别缺失值、清理空行/空列并智能转换列类型。
- 变量选择:勾选参与聚类的数值型变量(至少 1 个)。
- 聚类方法:K-means 与层次聚类两种,K-means 支持设置 \(k\)、标准化、随机种子与肘部图最大 \(k\);层次聚类支持欧氏、曼哈顿、最大、闵可夫斯基距离及最近邻、最远邻、平均、Ward 连接法。
- 结果展示:
- 聚类结果散点图(按簇着色)。
- 肘部图(K-means)与树状图(层次聚类,红框标出 \(k\) 簇)。
- 各类样本量表与簇中心表(K-means 原始尺度)。
- 聚类结果数据预览(含 Cluster 列)。
- AI 智能分析:解读各簇特征差异并评估聚类数(每日限 3 次,需配置 API 密钥)。
- 报告下载:聚类结果(CSV/Excel)及包含各类样本量的 HTML 报告。
使用建议
- 先探索后聚类:先用样本量较小的数据尝试不同 \(k\),结合肘部图观察 WSS 变化,获得关于簇数的参考判断。
- 标准化勤核对:默认开启标准化,若业务上需要保留量纲差异,可在对比后决定是否关闭。
- 方法互补:可用层次聚类观察整体层次结构,再用 K-means 对大规模样本做最终分群。
- 固定随机种子:保持种子一致,使结果可复现,便于与同事或不同批次结果对比。
- 结果业务化:簇中心与各类样本量可帮助命名各簇(如”高价值客户”),但分组意义需由业务确认。
- AI 分析辅助:配置 API 密钥后,可让 AI 协助解读簇差异并评估 \(k\) 是否合适。
平台界面

平台界面包含:数据上传区、聚类方法与参数设置区(k、标准化、随机种子、距离度量、连接法)、聚类结果散点图、肘部图/树状图、各类样本量、簇中心、结果预览及 AI 分析模块
参考文献
- MacQueen, J. (1967). Some Methods for Classification and Analysis of Multivariate Observations. Proceedings of the 5th Berkeley Symposium on Mathematical Statistics and Probability.
- Ward, J. H. (1963). Hierarchical Grouping to Optimize an Objective Function. Journal of the American Statistical Association, 58(301), 236-244.
- Jain, A. K., Murty, M. N., & Flynn, P. J. (1999). Data Clustering: A Review. ACM Computing Surveys, 31(3), 264-323.