中文新词挖掘
方法概述
中文新词挖掘(New Words Mining)是一种从大规模中文文本中自动发现和提取新词、未登录词的文本挖掘方法。本工具基于凝聚度(Solidity)与自由度(Entropy)两大统计特征,从文本中识别潜在的新词语,适用于领域专有词汇、网络流行语、学术名词等新词的自动发现。
其核心思想是:
- 凝聚度:衡量候选词内部字符之间结合的紧密程度,凝聚度越高,说明该候选组合在语料中越稳定地作为一个整体出现。
- 自由度:衡量候选词左右邻接字符的丰富程度,自由度越高,说明该词能够在多样的语境中独立使用。
- 新词概率:综合凝聚度、自由度与词频等信息,对候选词成为真正新词的概率进行综合评估。
工具采用”预处理 → 候选词提取 → 统计特征计算 → 多指标评估 → 关键词筛选”的流程,支持自定义停用词、过滤单字词、纯数字、英文单词与标点符号等,并可对挖掘结果按词频、凝聚度、自由度或新词概率排序。
方法原理
中文新词挖掘的核心是基于统计特征识别未被词典收录的新词,主要包括以下三个环节:
1. 候选词提取
对语料进行 N 元切分(N-gram),枚举长度为 2 至最大短语长度之间的所有字符组合,作为候选词集合 \(W = \{w_1, w_2, \dots, w_n\}\)。
2. 凝聚度(Solidity)
凝聚度衡量候选词内部各字符结合成一个整体的紧密程度。对候选词 \(w = c_1 c_2 \dots c_k\),定义:
\[ \text{Solidity}(w) = \min_i \frac{P(c_1 c_2 \dots c_k)}{P(c_1 \dots c_i) \times P(c_{i+1} \dots c_k)} \]
其中 \(P(\cdot)\) 为相应字符片段在语料中的出现概率。凝聚度越高,说明该组合作为一个整体出现的稳定性越强,越可能是真正成词的组合。
3. 自由度(Entropy)
自由度衡量候选词左右邻接元素的丰富程度。对候选词 \(w\),统计其左侧邻接字符集合 \(L\) 与右侧邻接字符集合 \(R\),分别计算信息熵:
\[ H_L(w) = -\sum_{x \in L} p(x) \log p(x), \qquad H_R(w) = -\sum_{x \in R} p(x) \log p(x) \]
自由度取左右熵中的较小值 \(H(w) = \min(H_L(w), H_R(w))\)。自由度越高,说明该词能够在多样化的语境中独立出现,而非仅固定搭配于特定上下文。
4. 新词概率综合评估
综合词频、凝聚度与自由度,通过加权组合得到候选词成为新词的综合概率:
\[ P_{\text{new}}(w) = f(\text{freq}(w), \text{Solidity}(w), H(w)) \]
按词频、凝聚度、自由度或新词概率排序后,结合阈值筛选得到最终的新词列表。
使用流程
在平台左侧菜单选择“中文文本分析 → 中文新词挖掘”,点击“开始智算”进入工具界面,按下述流程操作:
Step 1 数据准备
- 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
- CSV/Excel 文件:第一列为文本内容。
- TXT 文件:每行一个文本段落。
- 可点击“下载数据模板”获取标准模板,或点击“方法介绍”查看算法说明。
Step 2 新词挖掘参数设置
在“新词挖掘参数设置”区域设定最小/最大词语长度、最小词频数、显示 Top N 新词数、最小凝聚度、最小自由度、最小新词概率及排序方式等参数。
Step 3 关键词筛选
可输入关键词进行过滤(每行一个),仅显示包含指定关键词的新词;留空则显示所有新词。
Step 4 高级设置
- 上传或直接输入停用词(TXT 每行一个词,Excel 第一列为停用词)。
- 选择过滤项:单字词、纯数字、英文单词、标点符号。
- 设定最大短语长度字符数。
Step 5 开始分析
点击“开始新词挖掘”按钮执行分析,进度条显示处理过程。
Step 6 结果查看
查看“新词挖掘原理”(计算过程说明)、新词列表、优质新词与统计分析等标签页,并下载结果。
参数说明
| 参数 | 默认值 | 说明 |
|---|---|---|
| 最小词语长度 | 2 | 候选词最少包含的汉字数(1-10) |
| 最大词语长度 | 4 | 候选词最多包含的汉字数(2-10) |
| 最小词频数 | 5 | 候选词在语料中出现的最低次数(1-100) |
| 显示 Top N 新词 | 100 | 结果中显示的新词数量(10-500) |
| 最小凝聚度 | 50 | 候选词内部结合紧密程度的下限(0-1000) |
| 最小自由度 | 0.5 | 候选词左右语境丰富程度的下限(0-10) |
| 最小新词概率 | 0.1 | 候选词成为新词的综合概率下限(0-1) |
| 排序方式 | 词频 | 支持按词频、凝聚度、自由度、新词概率排序 |
| 过滤单字词 | 开 | 过滤仅含单个汉字的候选词 |
| 过滤纯数字 | 开 | 过滤纯数字候选词 |
| 过滤英文单词 | 开 | 过滤英文候选词 |
| 过滤标点符号 | 开 | 过滤含标点的候选词 |
| 最大短语长度字符数 | 20 | 可提取的最大短语长度(5-50) |
案例分析
案例背景:从近一年的《自然语言处理》领域论文摘要中挖掘新兴学术术语。
- 数据:200 段论文摘要(TXT,每行一段),语料约 5 万字。
- 参数:最小词长 2、最大词长 6、最小词频 5、最小凝聚度 50、最小自由度 0.5、按词频排序。
分析结果示例:工具输出以下三张结果表——
| 排序 | 候选词 | 词频 | 凝聚度 | 自由度 | 新词概率 |
|---|---|---|---|---|---|
| 1 | 大语言模型 | 156 | 312.5 | 4.8 | 0.92 |
| 2 | 提示工程 | 87 | 268.3 | 3.9 | 0.88 |
| 3 | 思维链 | 64 | 245.1 | 3.5 | 0.85 |
| 4 | 检索增强生成 | 42 | 221.7 | 3.1 | 0.81 |
其中“大语言模型”凝聚度最高,说明该组合在语料中结合较稳定;自由度较高说明其可在“基于……”、“……的快速发展”等多样的语境中独立出现,符合新词的判定标准,可被识别为领域新词。
结论:在本示例语料中,工具挖掘出 30 余个候选新词,其中排名靠前的词与近年 NLP 领域的常见术语一致,体现了基于凝聚度与自由度的方法在领域术语发现上的可用性。
常见问题
Q1: 凝聚度、自由度各代表什么?
A: 凝聚度衡量候选词内部字符结合的紧密程度,值越高表示该组合越倾向于作为一个整体成词;自由度衡量候选词左右邻接字符的多样性,值越高表示该词能够在更多样的语境下独立出现。高凝聚度 + 高自由度的候选词最可能是真正的新词。
Q2: 挖掘出的候选词包含大量无意义组合怎么办?
A: 可适当提高“最小凝聚度”“最小自由度”和“最小词频数”阈值;同时开启“过滤单字词/纯数字/英文/标点”选项,并上传领域停用词表。
Q3: 为什么某些明显是词语的组合没有出现?
A: 常见原因是词频阈值过高(筛选掉了低频词),或该组合被作为停用词过滤。可降低最小词频数并检查停用词表。
Q4: 什么是未登录词?
A: 未登录词指不在分词词典中的词语,例如专业术语、人名地名、网络新词等。新词挖掘正是通过统计特征自动发现这类未登录词。
Q5: 新词概率是如何计算的?
A: 工具综合候选词的凝聚度、自由度与词频等信息,通过加权综合评估得到候选词成为新词的概率(0-1)。概率越高,新词的可靠性越高。
平台功能
- 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB;提供数据模板下载。
- 参数设置:词长范围、词频、凝聚度、自由度、新词概率、排序方式及关键词筛选。
- 自定义词典:停用词表文件上传或直接输入。
- 过滤选项:单字词、纯数字、英文单词、标点符号过滤,最大短语长度控制。
- 结果展示:
- 新词挖掘原理(算法计算过程说明)
- 新词列表(完整候选词表)
- 优质新词(高可靠性新词)
- 统计分析(词频分布、长度分布、指标分布等统计图表)
- 结果导出:下载完整新词列表、优质新词、统计报告(Excel)与分析报告(HTML)。
- AI 智能分析:基于 DeepSeek 大模型自动解读挖掘结果,提供领域新词分析与应用建议(每日限 3 次)。
使用建议
语料准备:语料量越大、越专业,新词挖掘效果越好。建议单文档一个段落(TXT 每行一段)以便保留语境信息。
参数调优:先使用默认参数跑一遍,再根据结果逐步收紧或放宽阈值。若新词过少,可降低最小词频与凝聚度;若噪音过多,则提高阈值。
停用词与过滤:针对特定领域(如医学、法律)上传专业停用词表,并开启单字/数字/英文/标点过滤,有助于提升新词质量。
结果验证:挖掘出的新词建议结合领域知识人工抽检。利用“优质新词”标签页快速定位高可信词,并通过排序与统计功能进行多角度评估。
与分词联用:可将挖掘出的新词加入“中文文本分词”工具的自定义词典,提升后续分词、词云、主题等下游分析的准确性。
平台界面

平台界面包含:数据上传区、新词挖掘参数设置区、关键词筛选、高级设置、结果展示(新词列表、优质新词、统计分析)及 AI 分析模块
参考文献:
Feng, S., et al. (2021). An Unsupervised Method for Discovering Chinese New Words.
张京平 (2013). 基于统计与规则的中文新词识别. 中文信息学报.