中文聚类分析

方法概述

中文聚类分析(Chinese Text Clustering)是在无类别标签条件下,依据文本内容的相似性将文档自动划分为若干簇的无监督文本挖掘方法,广泛用于语料分组、主题探测、用户分群与重复内容识别等场景。

本工具提供完整的“特征向量化 → 聚类 → 质量评估 → 可视化”流程:

  • 特征表示:TF-IDF 向量化,支持归一化,可选移除停用词与去标点。
  • 聚类算法:K-Means、层次聚类、DBSCAN、高斯混合模型(GMM)、谱聚类。
  • 距离度量:余弦距离、欧氏距离、曼哈顿距离。
  • 自动确定聚类数:轮廓系数、Gap 统计量、肘部法则(WSS)或多种方法综合给出参考。
  • 聚类质量评估:轮廓系数、簇内平方和等指标。
  • 可视化:PCA、t-SNE、UMAP 降维散点图,每类关键词分析。

方法原理

文本聚类(Text Clustering)是一种无监督学习方法,核心思想是依据文本内容的相似性将文档自动划分为若干簇,使簇内相似度尽可能高、簇间差异尽可能大。其数学原理如下:

1. 文本向量化

与分类类似,先用 TF-IDF 将文本转化为向量 \(x_i\),并对向量做长度归一化:

\[ \hat{x}_i = \frac{x_i}{\|x_i\|_2} \]

归一化后,余弦相似度可等价于向量点积:\(\text{sim}(x_i, x_j) = x_i \cdot x_j\),便于高效计算。

2. 距离度量

  • 余弦距离\(d(x_i, x_j) = 1 - \cos(x_i, x_j)\),对方向敏感、对幅度不敏感,适合高维稀疏文本向量。
  • 欧氏距离 / 曼哈顿距离:基于坐标差值的 L2 / L1 范数,适用于已归一化或低维数据。

3. 聚类算法

  • K-Means:将样本划分为 \(K\) 个簇,最小化簇内平方和(WSS): \[ \min \sum_{k=1}^{K} \sum_{x \in C_k} \|x - \mu_k\|^2 \] 通过迭代更新簇中心 \(\mu_k\) 与样本归属收敛。
  • 层次聚类:自底向上(或自顶向下)合并最相似簇,形成树状结构,可按需剪枝得到不同粒度聚类。
  • DBSCAN:基于密度连通性,无需预设簇数,自动识别簇并标记噪声点。
  • GMM / 谱聚类:分别以高斯混合模型与图谱切分为基础,适合分布不规则或非凸数据。

4. 簇数确定与质量评估

  • 轮廓系数:综合簇内紧密性与簇间分离度,取值 \([-1, 1]\),越大越好: \[ s = \frac{b - a}{\max(a, b)} \] 其中 \(a\) 为样本到同簇其他样本的平均距离,\(b\) 为到最近异簇样本的平均距离。
  • Gap 统计量 / 肘部法则:基于 WSS 随簇数的变化趋势给出参考簇数。

5. 可视化

高维簇结构通过 PCA、t-SNE、UMAP 降维至二维后以散点图展示,并结合每簇代表关键词解释簇含义。

使用流程

在平台左侧菜单选择“中文文本分析 → 中文聚类分析”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为原始文本、第二列为分词结果(空格分隔)、第三列为词语数量。
  • TXT 文件:每行一个文本段落。

Step 2 特征工程

  • 设置最大特征维度(默认 1000)、最小词频(默认 2)、最大/最小文档频率。
  • 选择移除停用词、去除标点、TF-IDF 归一化。

Step 3 聚类算法设置

  • 选择聚类算法(K-Means / 层次 / DBSCAN / GMM / 谱聚类)。
  • 设置聚类数量(默认 5)与距离度量(默认余弦距离)。
  • 依算法配置特定参数:K-Means 初始中心次数与迭代次数;DBSCAN 邻域半径 eps 与最小点数 minPts;层次聚类的链接方法与距离计算方法。
  • 可勾选自动确定聚类数并选择方法。

Step 4 高级设置

  • 停用词文件上传或直接输入自定义停用词。
  • 选择降维可视化方法(PCA / t-SNE / UMAP)与随机种子。
  • 设置每类关键词数量、内容去重、显示详细过程。

Step 5 开始分析

点击“开始聚类分析”按钮执行聚类。

Step 6 结果查看与下载

查看聚类分析原理、聚类结果、聚类统计、聚类质量、关键词分析与聚类可视化等标签页,并下载结果。

参数说明

参数 默认值 说明
最大特征维度 1000 TF-IDF 特征数上限(100-5000)
最小词频 2 剔除低频词(1-10)
最大/最小文档频率 0.8 / 0.01 DTM 词频过滤范围
移除停用词 聚类前去除停用词
去除标点符号 去除标点
TF-IDF 归一化 对向量做长度归一化
聚类算法 K-Means K-Means / 层次 / DBSCAN / GMM / 谱聚类
聚类数量 5 目标簇数(2-20)
距离度量 余弦距离 余弦 / 欧氏 / 曼哈顿
K-Means 参数 初始10次,迭代100 聚类中心初始化次数与最大迭代
DBSCAN 参数 eps=0.5, minPts=5 邻域半径与最小点数
层次聚类参数 ward.D2 链接方法(ward/single/complete/average 等)
自动确定簇数 轮廓系数 / Gap 统计量 / 肘部法则 / 综合
降维可视化方法 PCA PCA / t-SNE / UMAP
每类关键词数量 10 每簇展示的关键词数(5-20)

案例分析

案例背景:对 600 条互联网行业新闻进行聚类,发现潜在报道主题。

  • 数据:CSV(文本、分词、词语数量)。
  • 参数:TF-IDF、余弦距离、K-Means(聚类数 5)、PCA 可视化、轮廓系数评估。

聚类结果示例

文档数 代表关键词
簇1 158 股价、融资、上市、估值、投资机构
簇2 132 芯片、算法、人工智能、算力、大模型
簇3 118 平台、监管、反垄断、数据、隐私
簇4 104 电商、直播、带货、用户增长、消费
簇5 88 员工、薪资、裁员、招聘、组织

质量评估示例:整体轮廓系数 0.47,其中簇1、簇2 内聚度较高(轮廓系数分别 0.55、0.53),说明“资本市场”与“AI 技术”主题最为鲜明;簇4、簇5 略有重叠,可考虑增加簇数或改用 t-SNE/UMAP 可视化进一步观察。

结论:K-Means 将 600 条新闻划分为 5 个可解释的簇,呈现了资本、技术、监管、消费、组织五大话题,簇内关键词与实际报道主题大体对应。

常见问题

Q1: 聚类分析与分类分析有何区别?

A: 分类是有监督方法,需要带标签数据训练模型;聚类是无监督方法,自动将相似文本归为一簇,不依赖标签。两者可用于互补验证。

Q2: 余弦距离与欧氏距离怎么选?

A: 文本 TF-IDF 向量维度高且稀疏,余弦距离度量方向相似性,通常效果最好;若数据已经归一化或维度较低,两种距离差异不大。

Q3: 如何确定合适的聚类数?

A: 可使用“自动确定聚类数”(轮廓系数、Gap 统计量、肘部法则等),或人工对比不同簇数下簇内关键词的可解释性。

Q4: 为什么部分簇区分不明显?

A: 可能因聚类数偏多、噪声词未清除或文档本身相似。可增加停用词、提高最小词频、降低最大文档频率,或尝试谱聚类/层次聚类。

Q5: DBSCAN 能自动发现簇数吗?

A: 可以。DBSCAN 无需预设簇数,根据密度自动聚簇并可将噪声点列为单独一类;但需合理设置 eps 与 minPts 两个参数,并对距离尺度敏感。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式(文本/分词/词语数量),文件大小限制 10MB。
  • 特征工程:特征维度、词频/文档频率过滤、停用词、去标点、TF-IDF 归一化。
  • 聚类算法:K-Means、层次聚类、DBSCAN、GMM、谱聚类及各自专属参数;距离度量选择;自动确定簇数。
  • 结果展示
    • 聚类分析(算法原理与计算过程说明)
    • 聚类结果(文档-簇归属表)
    • 聚类统计(各簇样本数与占比)
    • 聚类质量(轮廓系数等指标)
    • 关键词分析(每簇代表关键词)
    • 聚类可视化(PCA / t-SNE / UMAP 散点图)
  • 结果导出:下载聚类结果、簇关键词、可视化图片与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型对聚类结构进行自动解读(每日限 3 次)。

使用建议

  1. 预处理到位:先经“中文文本分词”分词,并重点去除停用词与通用词(如“我们、进行、通过”),可明显提升簇的可解释性。

  2. 簇数选择:优先勾选“自动确定聚类数”获取参考,再结合业务经验手工调整;簇数不宜过少(信息丢失)也不宜过多(簇间重叠)。

  3. 度量与算法搭配:文本聚类推荐“余弦距离 + K-Means/层次聚类”;对形状不规则的数据可尝试 DBSCAN 或谱聚类。

  4. 可视化核查:高维数据降维视图仅供参考,应结合“轮廓系数”与“每类关键词”综合判断聚类质量,避免仅凭散点图下结论。

  5. 结果应用:可将聚类结果与主题分析、情感分析联用——先用聚类粗分组,再对每簇做主题命名与情感判断,形成更完整的语料画像。

平台界面

官方地址:https://superr.online

中文聚类分析工具界面

平台界面包含:数据上传区、特征工程区、聚类算法设置区、结果展示(聚类结果、聚类统计、聚类质量、关键词分析、聚类可视化)及 AI 分析模块

参考文献

  1. MacQueen, J. (1967). Some Methods for Classification and Analysis of Multivariate Observations.

  2. Rousseeuw, P. J. (1987). Silhouettes: A Graphical Aid to the Interpretation and Validation of Cluster Analysis. J. Comput. Appl. Math.