英文新词挖掘

方法概述

英文新词挖掘(English New Words Mining)是一种从大规模英文文本中自动发现和提取新词、未登录词的文本挖掘方法。英文虽然以空格分隔词语,但存在复合词、词缀衍生词、网络新语(如 “metaverse”、“blockchain”)等未被词典收录的表达。本工具基于凝聚度(Solidity)自由度(Entropy)两大统计特征,从英文语料中自动识别潜在的新词语。

其核心思想是:

  • 凝聚度:衡量候选词内部单元(字/词素)结合的紧密程度,凝聚度越高说明该组合在语料中越稳定地作为整体出现。
  • 自由度:衡量候选词左右邻接字符/单词的丰富程度,自由度越高说明该词能在多样的语境中独立使用。
  • 新词概率:综合凝聚度、自由度与词频等信息,评估候选词成为真正新词的概率。

工具采用”预处理 → 候选词提取 → 统计特征计算 → 多指标评估 → 关键词筛选”的完整流程,支持自定义停用词、过滤单字符词、纯数字、英文标点等,可按词频、凝聚度、自由度或新词概率排序。

界面支持中英文双语切换(右上角”切换语言”按钮)。

方法原理

英文新词挖掘的核心是基于统计特征识别未被词典收录的新词或未登录表达,主要环节如下:

1. 候选词提取

对英文语料进行 N 元切分(N-gram),枚举由 2 至最大词语长度个单词构成的连续短语作为候选词集合(复合词、词缀衍生词、网络新语等多由多词组合或衍生构成)。

2. 凝聚度(Solidity)

凝聚度衡量候选词内部各单元(字符/词素)结合为一个整体的紧密程度。对候选词 \(w\),计算其整体出现概率与各组成部分独立出现概率的比值并取最小值:

\[ \text{Solidity}(w) = \min_i \frac{P(w)}{P(w_{\text{前段}}) \times P(w_{\text{后段}})} \]

凝聚度越高,说明该短语整体出现的稳定性越强、越可能是一个固定的成词组合。

3. 自由度(Entropy)

自由度衡量候选词左右邻接单元(字符/单词)的丰富程度,以左右邻接集的信息熵衡量:

\[ H(w) = \min(H_L(w), H_R(w)), \qquad H_L(w) = -\sum_{x \in L} p(x) \log p(x) \]

自由度越高,说明该词能够在多样化的语境中独立出现,而非被固定的上下文“锁死”。

4. 新词概率综合评估

综合词频、凝聚度与自由度,通过加权组合得到候选词成为新词的综合概率,结合阈值筛选与排序得到最终新词列表。

使用流程

在平台左侧菜单选择“英文文本分析 → 英文新词挖掘”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为文本内容;TXT 文件:每行一个文本。
  • 可点击“下载数据模板”获取模板,或点击“方法介绍”查看算法说明。

Step 2 新词挖掘参数设置

设置最小/最大词语长度、最小词频数、显示 Top N 新词数、最小凝聚度、最小自由度、最小新词概率及排序方式。

Step 3 关键词筛选

输入关键词(每行一个)进行过滤,仅显示包含指定关键词的新词;留空则显示全部。

Step 4 高级设置

  • 上传或直接输入停用词表(TXT 每行一个词,Excel 第一列为停用词)。
  • 选择过滤项:单字符词、纯数字、英文标点等;设置最大短语长度字符数。

Step 5 开始分析

点击“开始新词挖掘”按钮执行分析。

Step 6 结果查看与下载

查看新词挖掘原理、新词列表、优质新词与统计分析等标签页,并下载结果。

参数说明

参数 默认值 说明
最小词语长度 2 候选词最少包含的字符数(1-10)
最大词语长度 4 候选词最多包含的字符数(2-10)
最小词频数 5 候选词出现的最低次数(1-100)
显示 Top N 新词 100 结果中显示的新词数量(10-500)
最小凝聚度 50 候选词内部结合紧密程度下限(0-1000)
最小自由度 0.5 候选词语境丰富程度下限(0-10)
最小新词概率 0.1 成为新词的综合概率下限(0-1)
排序方式 词频 按词频 / 凝聚度 / 自由度 / 新词概率
过滤单字符词 过滤仅含单个字符的候选词
过滤纯数字 过滤纯数字候选词
过滤标点符号 过滤含标点的候选词
最大短语长度字符数 20 可提取的最大短语长度(5-50)

案例分析

案例背景:从 300 篇科技新闻中挖掘近一年涌现的英文新词与术语。

  • 数据:TXT(每行一段新闻文本),语料约 8 万词。
  • 参数:词长 2-6、最小词频 5、凝聚度 50、自由度 0.5、按词频排序。

分析结果示例

排序 候选词 词频 凝聚度 自由度 新词概率
1 large language model 128 298.4 4.6 0.91
2 prompt engineering 74 251.2 3.8 0.87
3 generative AI 61 236.5 3.6 0.84
4 chain-of-thought 38 205.3 2.9 0.78

其中 “large language model” 凝聚度最高,说明该组合在语料中结合较稳定;自由度较高说明其可在 “based on …”、“the rise of …” 等多样的语境中独立出现,符合新词的判定标准。

结论:在本示例语料中,工具挖掘出 20 余个候选科技新词,其中排名靠前的词与近年 AI 领域常见术语一致,体现了基于凝聚度与自由度的新词挖掘方法的可用性。

常见问题

Q1: 英文还需要新词挖掘吗?

A: 需要。英文虽以空格分词,但复合词、词缀衍生词与网络新语(如 “deepfake”、“quiet quitting”)未必被词典收录,统计方法可自动发现这些未登录表达。

Q2: 凝聚度与自由度如何理解?

A: 凝聚度衡量候选词内部单元结合的紧密程度;自由度衡量其左右邻接的多样性。高凝聚度 + 高自由度的组合最可能是真正的新词。

Q3: 挖掘出大量无意义组合怎么办?

A: 可提高“最小凝聚度”“最小自由度”与“最小词频”阈值,同时开启单字符/数字/标点过滤,并上传领域停用词表。

Q4: 大小写会影响结果吗?

A: 工具默认对语料进行归一化处理。若需区分专有名词等大小写敏感词,可在预处理时注意保留,并检查结果中大小写变体。

Q5: 结果如何验证?

A: 建议结合领域知识人工抽检,或与外部语料、词典对照;利用“优质新词”标签页快速定位高可信新词。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB;提供数据模板下载。
  • 参数设置:词长范围、词频、凝聚度、自由度、新词概率、排序方式与关键词筛选。
  • 自定义词典:停用词表文件上传或直接输入。
  • 过滤选项:单字符词、纯数字、标点符号过滤,最大短语长度控制。
  • 双语界面:中英文一键切换。
  • 结果展示:新词挖掘原理、新词列表、优质新词、统计分析(词频分布等图表)。
  • 结果导出:下载完整新词列表、优质新词、统计报告(Excel)与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型自动解读挖掘结果(每日限 3 次)。

使用建议

  1. 语料准备:语料量越大、主题越聚焦,挖掘效果越好;单文档一个段落(TXT 每行一段)可保留语境信息。

  2. 参数调优:先以默认参数运行,再依据结果调整阈值。新词过少则降低最小词频与凝聚度,噪音过多则提高阈值。

  3. 停用词与过滤:针对领域上传停用词表,开启单字符/数字/标点过滤,有助于提升新词质量。

  4. 结果验证:结合领域知识抽检,并将“优质新词”作为高可信候选优先使用。

  5. 与分词联用:将挖掘出的新词加入“英文文本分词”工具的自定义词典,提升后续词云、主题、分类等下游分析的准确性。

平台界面

官方地址:https://superr.online

英文新词挖掘工具界面

平台界面包含:数据上传区、新词挖掘参数设置区、关键词筛选、高级设置、结果展示(新词列表、优质新词、统计分析)及 AI 分析模块

参考文献

  1. Feng, S., et al. (2021). An Unsupervised Method for Discovering English New Words.

  2. 张京平 (2013). 基于统计与规则的英文新词识别. 中文信息学报.