中文情感分析

方法概述

中文情感分析(Chinese Sentiment Analysis)是对中文文本所表达的情感倾向(正向、负向或中性)进行识别与度量的文本挖掘方法,广泛应用于产品评论、舆情监测、用户反馈分析等场景。

本工具基于情感词典匹配完成情感分析,核心特点包括:

  • 支持自定义情感词典:可上传或直接输入正向词、负向词、否定词与程度副词。
  • 否定词处理:如“不”“没有”,可翻转词语的情感极性。
  • 程度副词处理:如“非常”“极其”,可增强或减弱情感强度。
  • 通过正向/负向分类阈值判定文本最终情感类别。
  • 输出情感得分、情感分布、高频情感词与正/负向情感词云。

方法原理

基于词典的情感分析方法(Lexicon-based Sentiment Analysis)通过匹配情感词典中的词语并对情感得分进行聚合,判断文本的情感倾向,核心步骤如下:

1. 情感词典构建

构建包含正向词负向词否定词程度副词的情感词典,每个情感词 \(w\) 赋予极性分值 \(p(w)\)(正向为正、负向为负)。

2. 分词与词性过滤

对文本进行分词与清洗,过滤停用词、标点等无情感信息成分,保留候选情感词序列 \(w_1, w_2, \dots, w_m\)

3. 情感得分计算

对文本的每条文本,逐词匹配词典计算情感得分。设第 \(i\) 个词前最近出现的程度副词强度为 \(d_i\)(如”非常”取 1.5、“稍微”取 0.5),否定词出现情况由 \(n_i \in \{0, 1\}\) 表示(出现则翻转极性),则文本整体情感得分为:

\[ \text{Score} = \sum_{i=1}^{m} (-1)^{n_i} \times d_i \times p(w_i) \]

其中 \((-1)^{n_i}\) 实现否定翻转,\(d_i\) 实现程度加权。

4. 情感分类

设正向分类阈值为 \(t_+\)、负向分类阈值为 \(t_-\),则:

\[ \text{类别} = \begin{cases} \text{正向} & \text{Score} > t_+ \\ \text{负向} & \text{Score} < t_- \\ \text{中性} & t_- \le \text{Score} \le t_+ \end{cases} \]

5. 结果统计

汇总各文本情感类别与得分,输出情感分布、高频情感词及正向/负向情感词云。

使用流程

在平台左侧菜单选择“中文文本分析 → 中文情感分析”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为原始文本、第二列为分词结果(空格分隔)、第三列为词语数量。
  • TXT 文件:每行一个文本段落。

Step 2 参数设置

  • 设置正向分类阈值(默认 0.1)与负向分类阈值(默认 -0.1)。
  • 设置最小词语长度(默认 2)。
  • 选择是否考虑否定词考虑程度副词内容去重去除标点符号

Step 3 高级设置(词典配置)

  • 正向词词典 / 负向词词典:上传文件或直接输入词语(每行一个)。
  • 否定词表:上传或输入“不、没、无、别”等。
  • 程度副词表:上传或输入“非常、极其、稍微”等。

Step 4 开始分析

点击“开始情感分析”按钮执行分析。

Step 5 结果查看与下载

查看情感分析结果、词语情感分析、情感统计、高频情感词、正向/负向情感词云等标签页,并下载结果。

参数说明

参数 默认值 说明
正向分类阈值 0.1 情感得分高于该值的文本判为正向(0-1)
负向分类阈值 -0.1 情感得分低于该值的文本判为负向(-1-0)
最小词语长度 2 参与情感计算的词语最小长度(1-10)
考虑否定词 识别并翻转否定词后词语的情感极性
考虑程度副词 识别程度副词并调节情感强度
内容去重 对重复文本去重后再分析
去除标点符号 去除标点后再分词计算
正向/负向词典 内置 可上传或直接输入自定义词典

案例分析

案例背景:对 200 条电商购物评论进行情感分析。

  • 数据:CSV(文本、分词、词语数量)。
  • 参数:正阈值 0.1、负阈值 -0.1,开启否定词与程度副词处理。

示例文本情感得分

评论 情感得分 情感类别
商品质量很好,值得购买 0.42 正向
物流太慢了,很不满意 -0.35 负向
一般般,没什么特别的感觉 0.03 中性
价格便宜,但不耐用 0.12 正向

其中“很不满意”中程度副词“很”放大“不满意”的负面强度,被正确判为负向;“但不耐用”含转折,工具按词语级情感累加得到整体得分。

情感分布统计示例:正向 118 条(59%)、负向 52 条(26%)、中性 30 条(15%)。

结论:工具识别出多数评论为正向,并通过否定词与程度副词处理捕捉了“很不满意”等强负面表达,为企业评估产品质量与物流服务提供了参考。

常见问题

Q1: 什么是正向/负向分类阈值?

A: 文本情感得分为其词语情感分值累加(可含否定翻转与程度加权)的汇总。得分高于正向阈值判为正向,低于负向阈值判为负向,介于两者之间判为中性。

Q2: 为什么“不好”被判为负向?

A: “好”为正向词,但被否定词“不”修饰后极性被翻转,因此“不好”计为负向,这正是“考虑否定词”功能的作用。

Q3: 内置词典不够用怎么办?

A: 可在“高级设置”中上传或直接输入领域正向词、负向词、否定词与程度副词,平台将自动合并内置词典与自定义词典。

Q4: 中性文本如何判定?

A: 情感得分处于负向阈值与正向阈值之间(如 -0.1~0.1)的文本判为中性。可通过调整阈值缩小或放大中性区间。

Q5: 情感分析结果可信吗?

A: 词典法依赖词典覆盖度与阈值设置,对讽刺、反语等复杂表达识别有限。建议对典型错误样本补充自定义词典,并与人工标注结果进行对比评估。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式(文本/分词/词语数量),文件大小限制 10MB。
  • 参数设置:正负阈值、最小词长、否定词/程度副词/去重/去标点开关。
  • 自定义词典:正向词、负向词、否定词、程度副词文件上传或直接输入。
  • 结果展示
    • 情感分析(算法与计算过程说明)
    • 情感分析结果(每条文本的情感得分与类别)
    • 词语情感分析(各词语情感极性明细)
    • 情感统计(情感类别分布统计)
    • 高频情感词(Top 正向/负向情感词)
    • 正向情感词云 / 负向情感词云
  • 结果导出:下载情感分析明细、统计结果与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型自动解读情感分布,提供舆情与口碑分析建议(每日限 3 次)。

使用建议

  1. 数据预处理:使用“中文文本分词”工具对原始文本分词,得到“文本、分词、词语数量”三列格式后导入,可提高情感分析的准确性与速度。

  2. 词典本地化:针对业务领域(如餐饮、医疗、金融)补充自定义情感词典,是提升效果的有效手段;否定词与程度副词也建议按领域更新。

  3. 阈值调优:先以默认阈值运行,观察中性与两极性比例是否符合业务认知,再微调阈值使分类结果更贴合实际。

  4. 结果验证:随机抽检情感分析结果与人工判断的吻合度,对典型误判(尤其是转折句、反讽句)定位原因并修正词典。

  5. 趋势监测:对时间序列评论反复运行本工具,结合“情感统计”观察正负向占比变化,用于舆情预警与口碑追踪。

平台界面

官方地址:https://superr.online

中文情感分析工具界面

平台界面包含:数据上传区、参数设置区、词典配置区(正向词、负向词、否定词、程度副词)、结果展示(情感得分、情感分布、情感词云)及 AI 分析模块

参考文献

  1. Liu, B. (2012). Sentiment Analysis and Opinion Mining. Morgan & Claypool.

  2. 姜德成, 等 (2007). 基于情感词典的中文文本情感分析.