中文文本分词
方法概述
中文文本分词(Chinese Word Segmentation)是将连续的汉字序列按语义切分为一个个独立词语的过程,是中文文本挖掘的基础环节。由于中文语句没有天然的空格分隔,分词质量的优劣直接影响词频统计、词云、情感、主题、分类、聚类等下游分析的准确性。
本工具提供以下核心能力:
- 支持自定义词典,可将领域术语、人名地名等未登录词加入词典,提升分词准确率。
- 支持同义词合并,将语义相同的词语归并统计,如“电脑=计算机,微机”。
- 支持停用词过滤,排除“的、了、在、是”等高频无意义词语。
- 支持词性过滤,按名词、动词、形容词等词性保留或剔除词语。
- 提供内容去重、去除标点/数字/空白/英文/网址等清洗选项。
- 输出完整的词频统计与可视化结果。
方法原理
中文文本分词(Chinese Word Segmentation)是将连续的汉字序列按语义切分为独立词语的过程。由于中文语句没有天然空格分隔,分词需借助词典匹配与统计模型相结合的策略,主要环节如下:
1. 分词算法
本工具采用基于词典的最大匹配法与统计语言模型相结合的策略:
- 正向最大匹配:从文本首部开始,选取与词典中最长词匹配的前缀作为切分结果,逐步后移。
- 反向最大匹配:从文本末尾开始,以词典中最长词匹配的倒序片段切分。
- 统计模型补充:对词典中未收录的未登录词,基于语料统计(如相邻字符共现强度、词频)自动识别,提升对新词与专有名词的切分能力。
2. 词频统计
切分完成后,对所得词语进行频次统计。设词语 \(w_i\) 在文本中出现的次数为 \(c_i\),其相对频率为:
\[ f_i = \frac{c_i}{\sum_j c_j} \]
输出高频词表用于词云、情感、主题等下游分析。
3. 清洗与过滤
对切分结果执行内容去重、去标点、去数字、去空白、去英文、去网址等清洗,并通过同义词合并、停用词过滤与词性过滤,得到聚焦核心概念的词语集合。
使用流程
在平台左侧菜单选择“中文文本分析 → 中文文本分词”,点击“开始智算”进入工具界面:
Step 1 数据准备
- 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
- CSV/Excel 文件:第一列为文本内容;TXT 文件:每行一个文本段落。
Step 2 参数设置
- 设定最小/最大词语长度(默认 2 / 20)。
- 选择清洗选项:内容去重、去除标点、去除数字、去除空白、去除英文、去除网址。
- 勾选需保留的词性(默认保留名词、动词、形容词、副词)。
Step 3 高级设置
- 自定义词典:上传词典文件(TXT 每行一个词,Excel 第一列为词语)或直接输入自定义词语。
- 同义词设置:按“主词=同义词1,同义词2”格式上传或输入。
- 停用词设置:上传停用词文件或直接输入(每行一个)。
Step 4 开始分析
点击“开始分词分析”按钮,工具将自动完成清洗、分词、同义词合并、停用词过滤与词性过滤。
Step 5 结果查看与下载
查看分词结果、词频统计、统计分析等标签页,可下载词频统计、分词结果与分析报告。
参数说明
| 参数 | 默认值 | 说明 |
|---|---|---|
| 最小词语长度 | 2 | 仅保留长度不低于该值的词语(1-10) |
| 最大词语长度 | 20 | 仅保留长度不超过该值的词语(5-50) |
| 内容去重 | 开 | 去除重复文本内容 |
| 去除标点符号 | 开 | 去除标点字符 |
| 去除数字 | 开 | 去除纯数字及数字词 |
| 去除空白字符 | 开 | 去除多余空白 |
| 去除英文 | 开 | 去除英文单词 |
| 去除网址 | 开 | 去除 URL 链接 |
| 保留词性 | 名词/动词/形容词/副词 | 词性过滤(n/v/a/d 默认开启;m/q/r/p/c/u/e/o 可选) |
案例分析
案例背景:对 100 条新能源汽车用户评价进行分词与词频统计,挖掘用户关注点。
- 数据:CSV 文件,第一列为评论文本(如“续航里程非常出色,但充电速度有待提升”)。
- 参数:默认词长范围、保留名词/动词/形容词/副词、开启清洗选项。
分析结果示例:
| 排名 | 词语 | 词性 | 词频 |
|---|---|---|---|
| 1 | 续航 | n | 86 |
| 2 | 充电 | v | 71 |
| 3 | 智能 | a | 64 |
| 4 | 空间 | n | 58 |
| 5 | 舒适 | a | 52 |
结论:分词与词频统计识别出用户关注度较高的“续航、充电、智能、空间、舒适”等关键词,为产品改进提供数据支撑。加入“快充”“驾驶辅助”等自定义词典后,相关词语可被切分为整体词。
常见问题
Q1: 为什么有些领域术语被错误切分?
A: 分词词典中未收录该术语所致。在“自定义词典”中加入这些术语(每行一个)后重新分词即可。
Q2: 同义词合并有什么用?
A: 可将“电脑”与“计算机”等语义相同的词语归并为“电脑”统一统计,避免词频被分散,使统计结果更集中、更有解释力。
Q3: 保留词性选项如何选择?
A: 若关注核心概念,建议保留名词、动词、形容词、副词;若仅做关键词提取,通常只保留名词和动词效果更好。数词、量词、助词等一般不建议保留。
Q4: 分词结果与预期不符怎么办?
A: 可组合使用自定义词典、停用词表和词性过滤:先加自定义词典提升切分准确率,再用停用词表去除噪音词,最后用词性过滤聚焦目标词类。
平台功能
- 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB;提供数据模板与方法介绍下载。
- 参数设置:词长范围、清洗选项、词性保留设置。
- 自定义词典:词典文件上传或直接输入;同义词文件上传或直接输入;停用词文件上传或直接输入。
- 结果展示:
- 文本分词(分词算法说明与处理过程)
- 分词结果(分词后的词语表)
- 词频统计(Top 高频词表)
- 统计分析(词频分布、长度分布等统计图表)
- 结果导出:下载词频统计(Excel)、分词结果与分析报告(HTML)。
- AI 智能分析:基于 DeepSeek 大模型对分词与词频结果进行自动解读(每日限 3 次)。
使用建议
词典先行:对专业语料(医学、法律、金融等),先通过“中文新词挖掘”工具或人工整理领域术语,再录入自定义词典,可有效提升分词质量。
合理清洗:开启内容去重、去除数字/英文/网址等选项可减少噪音词对词频统计的干扰,但需注意是否会影响研究内容完整性。
词性过滤:做关键词/主题类分析时保留名词与动词即可;做全文本描述性统计时可保留更多词性。
同义词归一:分析评论、问卷等自由文本前,建议先建立同义词表,将“很棒/非常好/十分优秀”等归一为同一词语,便于统计。
上下游联动:分词结果是词云、情感、主题、分类、聚类等工具的重要输入,建议将与目标场景一致的参数组合保存,保持分析口径统一。
平台界面

平台界面包含:数据上传区、参数设置区、高级设置(自定义词典、同义词、停用词)、结果展示(分词结果、词频统计、统计分析)及 AI 分析模块
参考文献:
刘群, 等 (2004). 基于层叠隐马尔可夫模型的中文词法分析. 计算机研究与发展.
Xue, N. (2003). Chinese Word Segmentation as Character Tagging. IJCNLP.