中文新词挖掘

方法概述

中文新词挖掘(New Words Mining)是一种从大规模中文文本中自动发现和提取新词、未登录词的文本挖掘方法。本工具基于凝聚度(Solidity)自由度(Entropy)两大统计特征,从文本中识别潜在的新词语,适用于领域专有词汇、网络流行语、学术名词等新词的自动发现。

其核心思想是:

  • 凝聚度:衡量候选词内部字符之间结合的紧密程度,凝聚度越高,说明该候选组合在语料中越稳定地作为一个整体出现。
  • 自由度:衡量候选词左右邻接字符的丰富程度,自由度越高,说明该词能够在多样的语境中独立使用。
  • 新词概率:综合凝聚度、自由度与词频等信息,对候选词成为真正新词的概率进行综合评估。

工具采用”预处理 → 候选词提取 → 统计特征计算 → 多指标评估 → 关键词筛选”的流程,支持自定义停用词、过滤单字词、纯数字、英文单词与标点符号等,并可对挖掘结果按词频、凝聚度、自由度或新词概率排序。

方法原理

中文新词挖掘的核心是基于统计特征识别未被词典收录的新词,主要包括以下三个环节:

1. 候选词提取

对语料进行 N 元切分(N-gram),枚举长度为 2 至最大短语长度之间的所有字符组合,作为候选词集合 \(W = \{w_1, w_2, \dots, w_n\}\)

2. 凝聚度(Solidity)

凝聚度衡量候选词内部各字符结合成一个整体的紧密程度。对候选词 \(w = c_1 c_2 \dots c_k\),定义:

\[ \text{Solidity}(w) = \min_i \frac{P(c_1 c_2 \dots c_k)}{P(c_1 \dots c_i) \times P(c_{i+1} \dots c_k)} \]

其中 \(P(\cdot)\) 为相应字符片段在语料中的出现概率。凝聚度越高,说明该组合作为一个整体出现的稳定性越强,越可能是真正成词的组合。

3. 自由度(Entropy)

自由度衡量候选词左右邻接元素的丰富程度。对候选词 \(w\),统计其左侧邻接字符集合 \(L\) 与右侧邻接字符集合 \(R\),分别计算信息熵:

\[ H_L(w) = -\sum_{x \in L} p(x) \log p(x), \qquad H_R(w) = -\sum_{x \in R} p(x) \log p(x) \]

自由度取左右熵中的较小值 \(H(w) = \min(H_L(w), H_R(w))\)。自由度越高,说明该词能够在多样化的语境中独立出现,而非仅固定搭配于特定上下文。

4. 新词概率综合评估

综合词频、凝聚度与自由度,通过加权组合得到候选词成为新词的综合概率:

\[ P_{\text{new}}(w) = f(\text{freq}(w), \text{Solidity}(w), H(w)) \]

按词频、凝聚度、自由度或新词概率排序后,结合阈值筛选得到最终的新词列表。

使用流程

在平台左侧菜单选择“中文文本分析 → 中文新词挖掘”,点击“开始智算”进入工具界面,按下述流程操作:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为文本内容
  • TXT 文件:每行一个文本段落。
  • 可点击“下载数据模板”获取标准模板,或点击“方法介绍”查看算法说明。

Step 2 新词挖掘参数设置

在“新词挖掘参数设置”区域设定最小/最大词语长度、最小词频数、显示 Top N 新词数、最小凝聚度、最小自由度、最小新词概率及排序方式等参数。

Step 3 关键词筛选

可输入关键词进行过滤(每行一个),仅显示包含指定关键词的新词;留空则显示所有新词。

Step 4 高级设置

  • 上传或直接输入停用词(TXT 每行一个词,Excel 第一列为停用词)。
  • 选择过滤项:单字词、纯数字、英文单词、标点符号。
  • 设定最大短语长度字符数。

Step 5 开始分析

点击“开始新词挖掘”按钮执行分析,进度条显示处理过程。

Step 6 结果查看

查看“新词挖掘原理”(计算过程说明)、新词列表、优质新词与统计分析等标签页,并下载结果。

参数说明

参数 默认值 说明
最小词语长度 2 候选词最少包含的汉字数(1-10)
最大词语长度 4 候选词最多包含的汉字数(2-10)
最小词频数 5 候选词在语料中出现的最低次数(1-100)
显示 Top N 新词 100 结果中显示的新词数量(10-500)
最小凝聚度 50 候选词内部结合紧密程度的下限(0-1000)
最小自由度 0.5 候选词左右语境丰富程度的下限(0-10)
最小新词概率 0.1 候选词成为新词的综合概率下限(0-1)
排序方式 词频 支持按词频、凝聚度、自由度、新词概率排序
过滤单字词 过滤仅含单个汉字的候选词
过滤纯数字 过滤纯数字候选词
过滤英文单词 过滤英文候选词
过滤标点符号 过滤含标点的候选词
最大短语长度字符数 20 可提取的最大短语长度(5-50)

案例分析

案例背景:从近一年的《自然语言处理》领域论文摘要中挖掘新兴学术术语。

  • 数据:200 段论文摘要(TXT,每行一段),语料约 5 万字。
  • 参数:最小词长 2、最大词长 6、最小词频 5、最小凝聚度 50、最小自由度 0.5、按词频排序。

分析结果示例:工具输出以下三张结果表——

排序 候选词 词频 凝聚度 自由度 新词概率
1 大语言模型 156 312.5 4.8 0.92
2 提示工程 87 268.3 3.9 0.88
3 思维链 64 245.1 3.5 0.85
4 检索增强生成 42 221.7 3.1 0.81

其中“大语言模型”凝聚度最高,说明该组合在语料中结合较稳定;自由度较高说明其可在“基于……”、“……的快速发展”等多样的语境中独立出现,符合新词的判定标准,可被识别为领域新词。

结论:在本示例语料中,工具挖掘出 30 余个候选新词,其中排名靠前的词与近年 NLP 领域的常见术语一致,体现了基于凝聚度与自由度的方法在领域术语发现上的可用性。

常见问题

Q1: 凝聚度、自由度各代表什么?

A: 凝聚度衡量候选词内部字符结合的紧密程度,值越高表示该组合越倾向于作为一个整体成词;自由度衡量候选词左右邻接字符的多样性,值越高表示该词能够在更多样的语境下独立出现。高凝聚度 + 高自由度的候选词最可能是真正的新词。

Q2: 挖掘出的候选词包含大量无意义组合怎么办?

A: 可适当提高“最小凝聚度”“最小自由度”和“最小词频数”阈值;同时开启“过滤单字词/纯数字/英文/标点”选项,并上传领域停用词表。

Q3: 为什么某些明显是词语的组合没有出现?

A: 常见原因是词频阈值过高(筛选掉了低频词),或该组合被作为停用词过滤。可降低最小词频数并检查停用词表。

Q4: 什么是未登录词?

A: 未登录词指不在分词词典中的词语,例如专业术语、人名地名、网络新词等。新词挖掘正是通过统计特征自动发现这类未登录词。

Q5: 新词概率是如何计算的?

A: 工具综合候选词的凝聚度、自由度与词频等信息,通过加权综合评估得到候选词成为新词的概率(0-1)。概率越高,新词的可靠性越高。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB;提供数据模板下载。
  • 参数设置:词长范围、词频、凝聚度、自由度、新词概率、排序方式及关键词筛选。
  • 自定义词典:停用词表文件上传或直接输入。
  • 过滤选项:单字词、纯数字、英文单词、标点符号过滤,最大短语长度控制。
  • 结果展示
    • 新词挖掘原理(算法计算过程说明)
    • 新词列表(完整候选词表)
    • 优质新词(高可靠性新词)
    • 统计分析(词频分布、长度分布、指标分布等统计图表)
  • 结果导出:下载完整新词列表、优质新词、统计报告(Excel)与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型自动解读挖掘结果,提供领域新词分析与应用建议(每日限 3 次)。

使用建议

  1. 语料准备:语料量越大、越专业,新词挖掘效果越好。建议单文档一个段落(TXT 每行一段)以便保留语境信息。

  2. 参数调优:先使用默认参数跑一遍,再根据结果逐步收紧或放宽阈值。若新词过少,可降低最小词频与凝聚度;若噪音过多,则提高阈值。

  3. 停用词与过滤:针对特定领域(如医学、法律)上传专业停用词表,并开启单字/数字/英文/标点过滤,有助于提升新词质量。

  4. 结果验证:挖掘出的新词建议结合领域知识人工抽检。利用“优质新词”标签页快速定位高可信词,并通过排序与统计功能进行多角度评估。

  5. 与分词联用:可将挖掘出的新词加入“中文文本分词”工具的自定义词典,提升后续分词、词云、主题等下游分析的准确性。

平台界面

官方地址:https://superr.online

中文新词挖掘工具界面

平台界面包含:数据上传区、新词挖掘参数设置区、关键词筛选、高级设置、结果展示(新词列表、优质新词、统计分析)及 AI 分析模块

参考文献

  1. Feng, S., et al. (2021). An Unsupervised Method for Discovering Chinese New Words.

  2. 张京平 (2013). 基于统计与规则的中文新词识别. 中文信息学报.