英文聚类分析

方法概述

英文聚类分析(English Text Clustering)是在无类别标签条件下,依据文本内容的相似性将文档自动划分为若干簇的无监督文本挖掘方法,广泛用于语料分组、主题探测、用户分群与重复内容识别等场景。

本工具提供完整的“特征向量化 → 聚类 → 质量评估 → 可视化”流程:

  • 特征表示:TF-IDF 向量化,支持归一化、去停用词、去标点。
  • 聚类算法:K-Means、层次聚类、DBSCAN、高斯混合模型(GMM)、谱聚类。
  • 距离度量:余弦距离、欧氏距离、曼哈顿距离。
  • 自动确定聚类数:轮廓系数、Gap 统计量、肘部法则(WSS)或多种方法综合给出参考。
  • 聚类质量评估:轮廓系数、簇内平方和等指标。
  • 可视化:PCA、t-SNE、UMAP 降维散点图,每类关键词分析。

界面支持中英文双语切换

方法原理

文本聚类(Text Clustering)是一种无监督学习方法,核心思想是依据文本内容的相似性将文档自动划分为若干簇,使簇内相似度尽可能高、簇间差异尽可能大。其数学原理如下:

1. 文本向量化

先用 TF-IDF 将文本转化为向量 \(x_i\),并对向量做长度归一化:

\[ \hat{x}_i = \frac{x_i}{\|x_i\|_2} \]

归一化后,余弦相似度可等价于向量点积。文本向量高维稀疏,适合用余弦度量方向相似性。

2. 距离度量

  • 余弦距离\(d(x_i, x_j) = 1 - \cos(x_i, x_j)\),对幅度不敏感,适合高维稀疏文本向量。
  • 欧氏距离 / 曼哈顿距离:基于坐标差值的 L2 / L1 范数,适用于已归一化或低维数据。

3. 聚类算法

  • K-Means:最小化簇内平方和(WSS): \[ \min \sum_{k=1}^{K} \sum_{x \in C_k} \|x - \mu_k\|^2 \] 通过迭代更新簇中心 \(\mu_k\) 与样本归属收敛。
  • 层次聚类:自底向上合并最相似簇,形成树状结构,可按需剪枝。
  • DBSCAN:基于密度连通性,无需预设簇数,自动识别簇并标记噪声点。
  • GMM / 谱聚类:以高斯混合模型与图谱切分为基础,适合分布不规则或非凸数据。

4. 簇数确定与质量评估

  • 轮廓系数:综合簇内紧密性与簇间分离度,取值 \([-1, 1]\),越大越好: \[ s = \frac{b - a}{\max(a, b)} \] 其中 \(a\) 为样本到同簇其他样本的平均距离,\(b\) 为到最近异簇样本的平均距离。
  • Gap 统计量 / 肘部法则:基于 WSS 随簇数的变化趋势给出参考簇数。

5. 可视化

高维簇结构通过 PCA、t-SNE、UMAP 降维至二维后以散点图展示,并结合每簇代表关键词解释簇含义。

使用流程

在平台左侧菜单选择“英文文本分析 → 英文聚类分析”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为原始文本、第二列为分词结果(空格分隔)、第三列为词语数量。
  • TXT 文件:每行一个文本段落。

Step 2 特征工程

  • 设置最大特征维度、最小词频、最大/最小文档频率。
  • 选择移除停用词、去除标点、TF-IDF 归一化。

Step 3 聚类算法设置

  • 选择聚类算法(K-Means / 层次 / DBSCAN / GMM / 谱聚类)。
  • 设置聚类数量(默认 5)与距离度量(默认余弦距离)。
  • 依算法配置特定参数(K-Means 初始次数;DBSCAN eps 与 minPts;层次聚类的链接方法等)。
  • 可勾选自动确定聚类数并选择方法。

Step 4 高级设置

  • 停用词文件上传或直接输入自定义停用词。
  • 选择降维可视化方法(PCA / t-SNE / UMAP)与随机种子、每类关键词数量等。

Step 5 开始分析

点击“开始聚类分析”按钮执行聚类。

Step 6 结果查看与下载

查看聚类分析原理、聚类结果、聚类统计、聚类质量、关键词分析与聚类可视化等标签页,并下载结果。

参数说明

参数 默认值 说明
最大特征维度 1000 TF-IDF 特征数上限(100-5000)
最小词频 2 剔除低频词(1-10)
最大/最小文档频率 0.8 / 0.01 DTM 词频过滤范围
移除停用词 聚类前去除停用词
去除标点符号 去除标点
TF-IDF 归一化 对向量做长度归一化
聚类算法 K-Means K-Means / 层次 / DBSCAN / GMM / 谱聚类
聚类数量 5 目标簇数(2-20)
距离度量 余弦距离 余弦 / 欧氏 / 曼哈顿
K-Means 参数 初始10次,迭代100 聚类中心初始化次数与最大迭代
DBSCAN 参数 eps=0.5, minPts=5 邻域半径与最小点数
层次聚类参数 ward.D2 链接方法(ward/single/complete/average 等)
自动确定簇数 轮廓系数 / Gap 统计量 / 肘部法则 / 综合
降维可视化方法 PCA PCA / t-SNE / UMAP
每类关键词数量 10 每簇展示的关键词数(5-20)

案例分析

案例背景:对 500 条英文科技新闻进行聚类,发现潜在报道主题。

  • 数据:CSV(文本、分词、词语数量)。
  • 参数:TF-IDF、余弦距离、K-Means(聚类数 5)、PCA 可视化、轮廓系数评估。

聚类结果示例

文档数 代表关键词
Cluster 1 132 funding, IPO, valuation, investors, startup
Cluster 2 118 AI, chip, algorithm, model, computing
Cluster 3 96 platform, regulation, antitrust, privacy, data
Cluster 4 88 e-commerce, retail, consumer, shopping
Cluster 5 66 hiring, layoffs, salary, workforce, culture

质量评估示例:整体轮廓系数 0.46,Cluster 1、Cluster 2 内聚度较高(分别为 0.56、0.54),说明”资本市场”与”AI 技术”主题最为鲜明;Cluster 4、Cluster 5 略有重叠。

结论:K-Means 将 500 条新闻划分为 5 个可解释的簇,呈现资本、技术、监管、消费、组织五大话题,簇内关键词与实际报道主题大体对应。

常见问题

Q1: 聚类分析与分类分析有何区别?

A: 分类是有监督方法(需要标签);聚类是无监督方法(自动分组)。两者可互补验证。

Q2: 余弦距离还是欧氏距离?

A: 文本 TF-IDF 向量高维稀疏,余弦距离度量方向相似性,通常效果最好;数据归一化或维度较低时差异不大。

Q3: 如何确定合适的聚类数?

A: 使用“自动确定聚类数”(轮廓系数、Gap 统计量、肘部法则等),或人工对比不同簇数下簇内关键词的可解释性。

Q4: 为什么部分簇区分不明显?

A: 可能因簇数偏多、噪声词未清除或文档相似度高。可增加停用词、提高最小词频、降低最大文档频率,或改用谱聚类/层次聚类。

Q5: DBSCAN 能自动发现簇数吗?

A: 可以。DBSCAN 无需预设簇数,按密度自动聚簇并将噪声点单独列出;但需合理设置 eps 与 minPts。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式(文本/分词/词语数量),文件大小限制 10MB。
  • 特征工程:特征维度、词频/文档频率过滤、停用词、去标点、TF-IDF 归一化。
  • 聚类算法:K-Means、层次、DBSCAN、GMM、谱聚类及各自专属参数;距离度量;自动确定簇数。
  • 双语界面:中英文一键切换。
  • 结果展示:聚类分析原理说明、聚类结果、聚类统计、聚类质量指标、每簇关键词分析、聚类可视化(PCA / t-SNE / UMAP)。
  • 结果导出:下载聚类结果、簇关键词、可视化图片与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型对聚类结构自动解读(每日限 3 次)。

使用建议

  1. 预处理到位:先经“英文文本分词”分词并去停用词、通用词,可明显提升簇的可解释性。

  2. 簇数选择:优先勾选“自动确定聚类数”获取参考,再结合业务经验手工调整。

  3. 度量与算法搭配:文本聚类推荐“余弦距离 + K-Means/层次”;形状不规则数据可试 DBSCAN 或谱聚类。

  4. 可视化核查:降维视图仅供参考,应结合“轮廓系数”与“每类关键词”综合判断聚类质量。

  5. 结果应用:将聚类结果与主题分析、情感分析联用,形成“聚类分组 → 主题命名 → 情感判断”的完整画像。

平台界面

官方地址:https://superr.online

英文聚类分析工具界面

平台界面包含:数据上传区、特征工程区、聚类算法设置区、结果展示(聚类结果、聚类统计、聚类质量、关键词分析、聚类可视化)及 AI 分析模块

参考文献

  1. MacQueen, J. (1967). Some Methods for Classification and Analysis of Multivariate Observations.

  2. Rousseeuw, P. J. (1987). Silhouettes: A Graphical Aid to the Interpretation and Validation of Cluster Analysis. J. Comput. Appl. Math.