中文情感分析
方法概述
中文情感分析(Chinese Sentiment Analysis)是对中文文本所表达的情感倾向(正向、负向或中性)进行识别与度量的文本挖掘方法,广泛应用于产品评论、舆情监测、用户反馈分析等场景。
本工具基于情感词典匹配完成情感分析,核心特点包括:
- 支持自定义情感词典:可上传或直接输入正向词、负向词、否定词与程度副词。
- 否定词处理:如“不”“没有”,可翻转词语的情感极性。
- 程度副词处理:如“非常”“极其”,可增强或减弱情感强度。
- 通过正向/负向分类阈值判定文本最终情感类别。
- 输出情感得分、情感分布、高频情感词与正/负向情感词云。
方法原理
基于词典的情感分析方法(Lexicon-based Sentiment Analysis)通过匹配情感词典中的词语并对情感得分进行聚合,判断文本的情感倾向,核心步骤如下:
1. 情感词典构建
构建包含正向词、负向词、否定词与程度副词的情感词典,每个情感词 \(w\) 赋予极性分值 \(p(w)\)(正向为正、负向为负)。
2. 分词与词性过滤
对文本进行分词与清洗,过滤停用词、标点等无情感信息成分,保留候选情感词序列 \(w_1, w_2, \dots, w_m\)。
3. 情感得分计算
对文本的每条文本,逐词匹配词典计算情感得分。设第 \(i\) 个词前最近出现的程度副词强度为 \(d_i\)(如”非常”取 1.5、“稍微”取 0.5),否定词出现情况由 \(n_i \in \{0, 1\}\) 表示(出现则翻转极性),则文本整体情感得分为:
\[ \text{Score} = \sum_{i=1}^{m} (-1)^{n_i} \times d_i \times p(w_i) \]
其中 \((-1)^{n_i}\) 实现否定翻转,\(d_i\) 实现程度加权。
4. 情感分类
设正向分类阈值为 \(t_+\)、负向分类阈值为 \(t_-\),则:
\[ \text{类别} = \begin{cases} \text{正向} & \text{Score} > t_+ \\ \text{负向} & \text{Score} < t_- \\ \text{中性} & t_- \le \text{Score} \le t_+ \end{cases} \]
5. 结果统计
汇总各文本情感类别与得分,输出情感分布、高频情感词及正向/负向情感词云。
使用流程
在平台左侧菜单选择“中文文本分析 → 中文情感分析”,点击“开始智算”进入工具界面:
Step 1 数据准备
- 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
- CSV/Excel 文件:第一列为原始文本、第二列为分词结果(空格分隔)、第三列为词语数量。
- TXT 文件:每行一个文本段落。
Step 2 参数设置
- 设置正向分类阈值(默认 0.1)与负向分类阈值(默认 -0.1)。
- 设置最小词语长度(默认 2)。
- 选择是否考虑否定词、考虑程度副词、内容去重、去除标点符号。
Step 3 高级设置(词典配置)
- 正向词词典 / 负向词词典:上传文件或直接输入词语(每行一个)。
- 否定词表:上传或输入“不、没、无、别”等。
- 程度副词表:上传或输入“非常、极其、稍微”等。
Step 4 开始分析
点击“开始情感分析”按钮执行分析。
Step 5 结果查看与下载
查看情感分析结果、词语情感分析、情感统计、高频情感词、正向/负向情感词云等标签页,并下载结果。
参数说明
| 参数 | 默认值 | 说明 |
|---|---|---|
| 正向分类阈值 | 0.1 | 情感得分高于该值的文本判为正向(0-1) |
| 负向分类阈值 | -0.1 | 情感得分低于该值的文本判为负向(-1-0) |
| 最小词语长度 | 2 | 参与情感计算的词语最小长度(1-10) |
| 考虑否定词 | 开 | 识别并翻转否定词后词语的情感极性 |
| 考虑程度副词 | 开 | 识别程度副词并调节情感强度 |
| 内容去重 | 开 | 对重复文本去重后再分析 |
| 去除标点符号 | 开 | 去除标点后再分词计算 |
| 正向/负向词典 | 内置 | 可上传或直接输入自定义词典 |
案例分析
案例背景:对 200 条电商购物评论进行情感分析。
- 数据:CSV(文本、分词、词语数量)。
- 参数:正阈值 0.1、负阈值 -0.1,开启否定词与程度副词处理。
示例文本情感得分:
| 评论 | 情感得分 | 情感类别 |
|---|---|---|
| 商品质量很好,值得购买 | 0.42 | 正向 |
| 物流太慢了,很不满意 | -0.35 | 负向 |
| 一般般,没什么特别的感觉 | 0.03 | 中性 |
| 价格便宜,但不耐用 | 0.12 | 正向 |
其中“很不满意”中程度副词“很”放大“不满意”的负面强度,被正确判为负向;“但不耐用”含转折,工具按词语级情感累加得到整体得分。
情感分布统计示例:正向 118 条(59%)、负向 52 条(26%)、中性 30 条(15%)。
结论:工具识别出多数评论为正向,并通过否定词与程度副词处理捕捉了“很不满意”等强负面表达,为企业评估产品质量与物流服务提供了参考。
常见问题
Q1: 什么是正向/负向分类阈值?
A: 文本情感得分为其词语情感分值累加(可含否定翻转与程度加权)的汇总。得分高于正向阈值判为正向,低于负向阈值判为负向,介于两者之间判为中性。
Q2: 为什么“不好”被判为负向?
A: “好”为正向词,但被否定词“不”修饰后极性被翻转,因此“不好”计为负向,这正是“考虑否定词”功能的作用。
Q3: 内置词典不够用怎么办?
A: 可在“高级设置”中上传或直接输入领域正向词、负向词、否定词与程度副词,平台将自动合并内置词典与自定义词典。
Q4: 中性文本如何判定?
A: 情感得分处于负向阈值与正向阈值之间(如 -0.1~0.1)的文本判为中性。可通过调整阈值缩小或放大中性区间。
Q5: 情感分析结果可信吗?
A: 词典法依赖词典覆盖度与阈值设置,对讽刺、反语等复杂表达识别有限。建议对典型错误样本补充自定义词典,并与人工标注结果进行对比评估。
平台功能
- 数据输入:支持 CSV、Excel、TXT 格式(文本/分词/词语数量),文件大小限制 10MB。
- 参数设置:正负阈值、最小词长、否定词/程度副词/去重/去标点开关。
- 自定义词典:正向词、负向词、否定词、程度副词文件上传或直接输入。
- 结果展示:
- 情感分析(算法与计算过程说明)
- 情感分析结果(每条文本的情感得分与类别)
- 词语情感分析(各词语情感极性明细)
- 情感统计(情感类别分布统计)
- 高频情感词(Top 正向/负向情感词)
- 正向情感词云 / 负向情感词云
- 结果导出:下载情感分析明细、统计结果与分析报告(HTML)。
- AI 智能分析:基于 DeepSeek 大模型自动解读情感分布,提供舆情与口碑分析建议(每日限 3 次)。
使用建议
数据预处理:使用“中文文本分词”工具对原始文本分词,得到“文本、分词、词语数量”三列格式后导入,可提高情感分析的准确性与速度。
词典本地化:针对业务领域(如餐饮、医疗、金融)补充自定义情感词典,是提升效果的有效手段;否定词与程度副词也建议按领域更新。
阈值调优:先以默认阈值运行,观察中性与两极性比例是否符合业务认知,再微调阈值使分类结果更贴合实际。
结果验证:随机抽检情感分析结果与人工判断的吻合度,对典型误判(尤其是转折句、反讽句)定位原因并修正词典。
趋势监测:对时间序列评论反复运行本工具,结合“情感统计”观察正负向占比变化,用于舆情预警与口碑追踪。
平台界面

平台界面包含:数据上传区、参数设置区、词典配置区(正向词、负向词、否定词、程度副词)、结果展示(情感得分、情感分布、情感词云)及 AI 分析模块
参考文献:
Liu, B. (2012). Sentiment Analysis and Opinion Mining. Morgan & Claypool.
姜德成, 等 (2007). 基于情感词典的中文文本情感分析.