中文词性标注

方法概述

中文词性标注(Chinese Part-of-Speech Tagging)是对已分词的词语赋予其语法词类(如名词、动词、形容词)的过程。词性标注是文本深层语义分析的基础,常用于句法分析、命名实体识别、情感分析、关键词抽取等任务。

本工具直接处理已分词数据,无需二次分词,输入格式为词语、频次、频率三列,基于预训练的依存语法词性分析模型完成标注:

  • 提供简体中文与通用中文两种预训练标注模型,可切换使用。
  • 将每个词语作为整体进行词性标注,避免对已分词结果的二次切分造成偏差。
  • 支持词语去重、低频词过滤与停用词过滤等预处理。
  • 按词性分组统计总频次与频率,输出词性分布与统计报表。
  • 采用 UPOS 通用词性标签体系(ADJ、NOUN、VERB 等 17 类)。

方法原理

词性标注(Part-of-Speech Tagging)是为词语赋予其语法词类(名词、动词、形容词等)的序列标注任务,本工具采用统计序列标注模型实现,核心思想如下:

1. 序列标注建模

给定词语序列 \(W = w_1, w_2, \dots, w_n\),词性标注的目标是寻找最优标签序列 \(T = t_1, t_2, \dots, t_n\),使条件概率最大化:

\[ T^* = \arg\max_T P(T \mid W) \]

2. 概率分解

基于一阶马尔可夫假设,将条件概率分解为发射概率转移概率的乘积:

\[ P(T \mid W) \propto \prod_{i=1}^{n} P(w_i \mid t_i) \times P(t_i \mid t_{i-1}) \]

  • 发射概率 \(P(w_i \mid t_i)\):给定词性 \(t_i\) 时观察到词语 \(w_i\) 的概率,反映词-性关联。
  • 转移概率 \(P(t_i \mid t_{i-1})\):相邻词性之间的搭配倾向,反映语法约束。

3. 最优路径求解

采用 Viterbi 动态规划算法 在标签空间上高效求解最优序列,得到每个词语最合理的词性标注结果。模型参数从大规模已标注语料中统计估计得出。

4. 词性分布统计

对标注结果按词性分组汇总频次与频率,输出词性分布表与可视化图表,供文体分析与后续筛选使用。

使用流程

在平台左侧菜单选择“中文文本分析 → 中文词性标注”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 数据为已分词数据,三列格式:第一列词语、第二列频次、第三列频率
  • CSV/Excel 文件:直接为上述三列;TXT 文件:每行一个词语,或制表符分隔的三列数据。
  • 文件大小不超过 10MB。

Step 2 参数设置

  • 选择“词语去重”(默认开启)与“过滤低频词”(默认关闭)。
  • 设置最小频次阈值(默认 1)。

Step 3 高级设置

  • 停用词设置:上传停用词文件(TXT 每行一个,Excel 第一列为停用词)或直接输入。
  • 模型选择chinese-gsdsimp(简体中文,推荐)或 chinese-gsd

Step 4 开始分析

点击“开始词性标注分析”按钮执行标注。

Step 5 结果查看与下载

查看词性标注结果、词性统计与统计分析等标签页,下载词性统计、标注结果与分析报告。

参数说明

参数 默认值 说明
词语去重 对输入词语去重后再标注
过滤低频词 是否过滤低频词语
最小频次阈值 1 仅保留频次不低于该值的词语(1-100)
选择标注模型 chinese-gsdsimp 简体中文模型(推荐)或通用中文模型
停用词 上传文件或直接输入(每行一个)

UPOS 词性标签说明:ADJ(形容词)、ADP(介词)、ADV(副词)、AUX(助动词)、CCONJ(并列连词)、DET(限定词)、INTJ(感叹词)、NOUN(名词)、NUM(数词)、PART(助词)、PRON(代词)、PROPN(专有名词)、PUNCT(标点)、SCONJ(从属连词)、SYM(符号)、VERB(动词)、X(其他)。

案例分析

案例背景:对某新闻语料的已分词词频表进行词性标注,分析报道的文体特征。

  • 数据:三列格式(词语、频次、频率),示例行为“发展 432 0.012”。
  • 参数:词语去重、模型 chinese-gsdsimp

分析结果示例

词语 词频 词性 词性含义
发展 432 NOUN 名词
经济 358 NOUN 名词
提高 301 VERB 动词
重要 176 ADJ 形容词
迅速 129 ADV 副词

词性分布统计示例:名词占比约 48%、动词约 27%、形容词约 12%、副词约 6%,其余为代词、助词、数词等。

结论:名词占比较高说明语料以描述性新闻报道为主,动词次之体现动态过程叙述,符合新闻文体的词性分布特征。

常见问题

Q1: 输入数据为什么要求是已分词数据?

A: 本工具专注“标注”环节,将每个词语作为整体标注,避免二次分词造成的错误。如需分词,请先使用“中文文本分词”工具生成词语词频表,再导入本工具。

Q2: chinese-gsdsimp 与 chinese-gsd 有何区别?

A: chinese-gsdsimp 为简体中文模型(推荐),适合简体语料;chinese-gsd 为通用中文模型,覆盖更广语域但简体语料精度略低。繁体语料建议使用 chinese-gsd。

Q3: 为什么某些词语的词性标注不符合直觉?

A: 中文词语常存在兼类现象(如“发展”可作名词也可作动词),标注结果取决于模型训练语料的上下文统计。可结合上下文或改用另一模型对比。

Q4: 词性统计有什么用途?

A: 词性分布反映文体与内容特征:学术文本名词比例高、口语文本代词与语气词多。同时可按词性筛词,例如只保留名词+动词用于后续主题分析。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式(词语/频次/频率三列),文件大小限制 10MB。
  • 预处理:词语去重、低频词过滤、停用词过滤。
  • 模型选择:简体与繁体两种中文词性标注预训练模型。
  • 结果展示
    • 词性标注(算法过程说明)
    • 词性标注结果(每个词语的标注结果表)
    • 词性统计(各类词性汇总表)
    • 统计分析(词性分布条形图等图表)
  • 结果导出:下载词性统计、词性标注结果与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型对词性分布结果进行自动解读(每日限 3 次)。

使用建议

  1. 数据来源:本工具输入为已分词词频表,可直接选用“中文文本分词”工具导出的词语词频结果,实现“分词 → 标注”流水线。

  2. 预处理组合:默认开启词语去重;若数据含大量低频噪音词,可开启低频词过滤并设置合理阈值;针对专业领域可上传领域停用词表。

  3. 模型选择:简体中文语料推荐 chinese-gsdsimp;若标注结果明显异常,可切换 chinese-gsd 对比。

  4. 结果解读:结合“词性统计”看整体分布判断文体;用“上传词频标注结果 词性标注结果”明细表进行具体词语核查。

  5. 下游应用:按词性筛选后,可将名词、动词组合结果用于主题模型、情感分析等工具,提升下游任务质量。

平台界面

官方地址:https://superr.online

中文词性标注工具界面

平台界面包含:数据上传区、参数设置区、模型选择、结果展示(词性标注结果、词性统计、统计分析)及 AI 分析模块

参考文献

  1. Marquardt, S. (2018). Universal Dependencies 词性标注体系.

  2. 王婷, 等 (2019). 基于序列标注的中文词性标注方法研究.