中文文本分词

方法概述

中文文本分词(Chinese Word Segmentation)是将连续的汉字序列按语义切分为一个个独立词语的过程,是中文文本挖掘的基础环节。由于中文语句没有天然的空格分隔,分词质量的优劣直接影响词频统计、词云、情感、主题、分类、聚类等下游分析的准确性。

本工具提供以下核心能力:

  • 支持自定义词典,可将领域术语、人名地名等未登录词加入词典,提升分词准确率。
  • 支持同义词合并,将语义相同的词语归并统计,如“电脑=计算机,微机”。
  • 支持停用词过滤,排除“的、了、在、是”等高频无意义词语。
  • 支持词性过滤,按名词、动词、形容词等词性保留或剔除词语。
  • 提供内容去重、去除标点/数字/空白/英文/网址等清洗选项。
  • 输出完整的词频统计与可视化结果。

方法原理

中文文本分词(Chinese Word Segmentation)是将连续的汉字序列按语义切分为独立词语的过程。由于中文语句没有天然空格分隔,分词需借助词典匹配与统计模型相结合的策略,主要环节如下:

1. 分词算法

本工具采用基于词典的最大匹配法统计语言模型相结合的策略:

  • 正向最大匹配:从文本首部开始,选取与词典中最长词匹配的前缀作为切分结果,逐步后移。
  • 反向最大匹配:从文本末尾开始,以词典中最长词匹配的倒序片段切分。
  • 统计模型补充:对词典中未收录的未登录词,基于语料统计(如相邻字符共现强度、词频)自动识别,提升对新词与专有名词的切分能力。

2. 词频统计

切分完成后,对所得词语进行频次统计。设词语 \(w_i\) 在文本中出现的次数为 \(c_i\),其相对频率为:

\[ f_i = \frac{c_i}{\sum_j c_j} \]

输出高频词表用于词云、情感、主题等下游分析。

3. 清洗与过滤

对切分结果执行内容去重、去标点、去数字、去空白、去英文、去网址等清洗,并通过同义词合并、停用词过滤与词性过滤,得到聚焦核心概念的词语集合。

使用流程

在平台左侧菜单选择“中文文本分析 → 中文文本分词”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为文本内容;TXT 文件:每行一个文本段落。

Step 2 参数设置

  • 设定最小/最大词语长度(默认 2 / 20)。
  • 选择清洗选项:内容去重、去除标点、去除数字、去除空白、去除英文、去除网址。
  • 勾选需保留的词性(默认保留名词、动词、形容词、副词)。

Step 3 高级设置

  • 自定义词典:上传词典文件(TXT 每行一个词,Excel 第一列为词语)或直接输入自定义词语。
  • 同义词设置:按“主词=同义词1,同义词2”格式上传或输入。
  • 停用词设置:上传停用词文件或直接输入(每行一个)。

Step 4 开始分析

点击“开始分词分析”按钮,工具将自动完成清洗、分词、同义词合并、停用词过滤与词性过滤。

Step 5 结果查看与下载

查看分词结果、词频统计、统计分析等标签页,可下载词频统计、分词结果与分析报告。

参数说明

参数 默认值 说明
最小词语长度 2 仅保留长度不低于该值的词语(1-10)
最大词语长度 20 仅保留长度不超过该值的词语(5-50)
内容去重 去除重复文本内容
去除标点符号 去除标点字符
去除数字 去除纯数字及数字词
去除空白字符 去除多余空白
去除英文 去除英文单词
去除网址 去除 URL 链接
保留词性 名词/动词/形容词/副词 词性过滤(n/v/a/d 默认开启;m/q/r/p/c/u/e/o 可选)

案例分析

案例背景:对 100 条新能源汽车用户评价进行分词与词频统计,挖掘用户关注点。

  • 数据:CSV 文件,第一列为评论文本(如“续航里程非常出色,但充电速度有待提升”)。
  • 参数:默认词长范围、保留名词/动词/形容词/副词、开启清洗选项。

分析结果示例

排名 词语 词性 词频
1 续航 n 86
2 充电 v 71
3 智能 a 64
4 空间 n 58
5 舒适 a 52

结论:分词与词频统计识别出用户关注度较高的“续航、充电、智能、空间、舒适”等关键词,为产品改进提供数据支撑。加入“快充”“驾驶辅助”等自定义词典后,相关词语可被切分为整体词。

常见问题

Q1: 为什么有些领域术语被错误切分?

A: 分词词典中未收录该术语所致。在“自定义词典”中加入这些术语(每行一个)后重新分词即可。

Q2: 同义词合并有什么用?

A: 可将“电脑”与“计算机”等语义相同的词语归并为“电脑”统一统计,避免词频被分散,使统计结果更集中、更有解释力。

Q3: 保留词性选项如何选择?

A: 若关注核心概念,建议保留名词、动词、形容词、副词;若仅做关键词提取,通常只保留名词和动词效果更好。数词、量词、助词等一般不建议保留。

Q4: 分词结果与预期不符怎么办?

A: 可组合使用自定义词典、停用词表和词性过滤:先加自定义词典提升切分准确率,再用停用词表去除噪音词,最后用词性过滤聚焦目标词类。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB;提供数据模板与方法介绍下载。
  • 参数设置:词长范围、清洗选项、词性保留设置。
  • 自定义词典:词典文件上传或直接输入;同义词文件上传或直接输入;停用词文件上传或直接输入。
  • 结果展示
    • 文本分词(分词算法说明与处理过程)
    • 分词结果(分词后的词语表)
    • 词频统计(Top 高频词表)
    • 统计分析(词频分布、长度分布等统计图表)
  • 结果导出:下载词频统计(Excel)、分词结果与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型对分词与词频结果进行自动解读(每日限 3 次)。

使用建议

  1. 词典先行:对专业语料(医学、法律、金融等),先通过“中文新词挖掘”工具或人工整理领域术语,再录入自定义词典,可有效提升分词质量。

  2. 合理清洗:开启内容去重、去除数字/英文/网址等选项可减少噪音词对词频统计的干扰,但需注意是否会影响研究内容完整性。

  3. 词性过滤:做关键词/主题类分析时保留名词与动词即可;做全文本描述性统计时可保留更多词性。

  4. 同义词归一:分析评论、问卷等自由文本前,建议先建立同义词表,将“很棒/非常好/十分优秀”等归一为同一词语,便于统计。

  5. 上下游联动:分词结果是词云、情感、主题、分类、聚类等工具的重要输入,建议将与目标场景一致的参数组合保存,保持分析口径统一。

平台界面

官方地址:https://superr.online

中文文本分词工具界面

平台界面包含:数据上传区、参数设置区、高级设置(自定义词典、同义词、停用词)、结果展示(分词结果、词频统计、统计分析)及 AI 分析模块

参考文献

  1. 刘群, 等 (2004). 基于层叠隐马尔可夫模型的中文词法分析. 计算机研究与发展.

  2. Xue, N. (2003). Chinese Word Segmentation as Character Tagging. IJCNLP.