英文情感分析
方法概述
英文情感分析(English Sentiment Analysis)是对英文文本所表达的情感倾向(正向、负向或中性)进行识别与度量的文本挖掘方法,广泛用于产品评论、社交媒体舆情、用户反馈分析等场景。
本工具基于情感词典匹配完成分析,核心特点包括:
- 内置情感词典:AFINN、Bing、NRC 三种主流英文情感词典,可选择使用或完全自定义。
- 自定义情感词典:可上传或直接输入正向词、负向词、否定词与程度副词。
- 否定词处理:如 “not、never”,可翻转词语情感极性。
- 程度副词处理:如 “very、extremely”,可增强或减弱情感强度。
- 词形处理:支持小写化、词干提取、词性还原与停用词过滤等预处理。
- 通过正向/负向分类阈值判定文本最终情感类别,输出情感分布、高频情感词与正/负向情感词云。
界面支持中英文双语切换。
方法原理
基于词典的情感分析(Lexicon-based Sentiment Analysis)通过匹配情感词典中的词语并对情感得分进行聚合,判断文本的情感倾向。以常见的 Bing 二值词典与 AFINN 带权词典为例,核心步骤如下:
1. 词典与权重
- Bing 词典:将词语分为正向(+1)与负向(-1)两类。
- AFINN 词典:为每个词赋予 -5 至 +5 的权重值,体现情感强弱。
- NRC 词典:标注词的八大情绪与正负极。
2. 预处理与词形处理
对小写化、词干提取或词性还原后的文本进行停用词过滤,保留候选情感词序列 \(w_1, w_2, \dots, w_m\)。
3. 情感得分计算
逐词匹配词典计算得分。设第 \(i\) 个词前最近的程度副词强度为 \(d_i\),否定词出现由 \(n_i \in \{0,1\}\) 表示(出现则翻转极性),则文本整体情感得分为:
\[ \text{Score} = \sum_{i=1}^{m} (-1)^{n_i} \times d_i \times p(w_i) \]
其中 \(p(w_i)\) 为该词在词典中的情感分值,\((-1)^{n_i}\) 实现否定翻转,\(d_i\) 实现程度加权。
4. 情感分类
设正向分类阈值为 \(t_+\)、负向分类阈值为 \(t_-\),则:
\[ \text{类别} = \begin{cases} \text{Positive} & \text{Score} > t_+ \\ \text{Negative} & \text{Score} < t_- \\ \text{Neutral} & t_- \le \text{Score} \le t_+ \end{cases} \]
5. 结果统计
汇总各文本情感类别与得分,输出情感分布、高频情感词及正向/负向情感词云。
使用流程
在平台左侧菜单选择“英文文本分析 → 英文情感分析”,点击“开始智算”进入工具界面:
Step 1 数据准备
- 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
- CSV/Excel 文件:第一列为文本内容;TXT 文件:每行一个文本段落。
Step 2 参数设置
- 选择情感词典(AFINN / Bing / NRC / 自定义)。
- 设置正向分类阈值(默认 0.1)与负向分类阈值(默认 -0.1)。
- 设置最小词语长度,选择是否考虑否定词、考虑程度副词、内容去重、去除停用词、小写化、词干提取、词性还原。
Step 3 高级设置(词典配置)
- 正向词词典 / 负向词词典:上传文件或直接输入词语(每行一个)。
- 否定词表:上传或输入 “not、never、no” 等。
- 程度副词表:上传或输入 “very、extremely、slightly” 等。
Step 4 开始分析
点击“开始情感分析”按钮执行分析。
Step 5 结果查看与下载
查看情感分析结果、词语情感分析、情感统计、高频情感词、正向/负向情感词云等标签页,并下载结果。
参数说明
| 参数 | 默认值 | 说明 |
|---|---|---|
| 情感词典选择 | Bing | AFINN / Bing / NRC / 自定义 |
| 正向分类阈值 | 0.1 | 情感得分高于该值判为正向(0-1) |
| 负向分类阈值 | -0.1 | 情感得分低于该值判为负向(-1-0) |
| 最小词语长度 | 2 | 参与情感计算的词语最小长度(1-10) |
| 考虑否定词 | 开 | 识别并翻转否定修饰词语的情感极性 |
| 考虑程度副词 | 开 | 识别程度副词并调节情感强度 |
| 内容去重 | 开 | 对重复文本去重后再分析 |
| 去除停用词 | 开 | 去除高频无意义词 |
| 转换为小写 / 词干提取 / 词性还原 | — | 词形处理选项 |
| 正向/负向/否定词/程度副词词典 | 内置 | 可上传或直接输入自定义词典 |
案例分析
案例背景:对 300 条英文外卖评论进行情感分析。
- 数据:CSV(第一列为评论文本)。
- 参数:Bing 词典、正阈值 0.1、负阈值 -0.1,开启否定词与程度副词处理,小写化。
示例文本情感得分:
| 评论 | 情感得分 | 情感类别 |
|---|---|---|
| The food is excellent and delivery is fast | 0.45 | 正向 |
| Very disappointed, food arrived cold | -0.38 | 负向 |
| Not bad, but nothing special | 0.04 | 中性 |
| Great taste but poor packaging | 0.11 | 正向 |
其中 “Very disappointed” 中程度副词 “very” 放大负面强度,被正确判为负向;“Not bad” 中否定词 “not” 翻转 “bad” 的极性,接近中性,符合语义。
情感分布统计示例:正向 161 条(54%)、负向 89 条(30%)、中性 50 条(16%)。
结论:工具反映了正负向评论分布,并通过否定词与程度副词处理识别了 “Not bad”“Very disappointed” 等带复杂修饰的表达。
常见问题
Q1: AFINN、Bing、NRC 三种词典有何区别?
A: AFINN 为带权分值词典(-5~5),能反映情感强弱;Bing 将词分为正负两类二值词典;NRC 提供八大情绪与正负极二维标签。三者在覆盖与评分方式上各有侧重,可对比选择。
Q2: 为什么 “not good” 被判为负向?
A: “good” 为正向词,被否定词 “not” 修饰后极性翻转,因此 “not good” 计为负向,这正是“考虑否定词”的作用。
Q3: 自定义词典与内置词典可以并用吗?
A: 选择“自定义”时会以自定义词典为准;选择内置词典时也可在“高级设置”上传补充正向词、负向词等,工具会自动合并。
Q4: 词干提取会影响情感判断吗?
A: 可能。词干提取会把 “disappointment” 变为 “disappoint” 等形式,若词典收录形式不一致会影响匹配,一般建议使用词性还原或关闭词形处理以保证匹配准确。
Q5: 如何提升领域准确性?
A: 补充业务领域(餐饮、医疗、金融)的正负向词与程度副词词典,并针对典型误判样本微调阈值,可获得较明显效果提升。
平台功能
- 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB。
- 参数设置:情感词典选择、正负阈值、最小词长、否定词/程度副词/去重/去停用词/词形处理开关。
- 自定义词典:正向词、负向词、否定词、程度副词文件上传或直接输入。
- 双语界面:中英文一键切换。
- 结果展示:情感分析原理说明、情感分析结果(逐条得分与类别)、词语情感分析、情感统计、高频情感词、正向/负向情感词云。
- 结果导出:下载情感分析明细、统计结果与分析报告(HTML)。
- AI 智能分析:基于 DeepSeek 大模型自动解读情感分布,提供口碑分析建议(每日限 3 次)。
使用建议
预处理:务必开启去停用词并做小写化;是否启用词性还原可视词典匹配情况而定。
词典本地化:针对业务领域补充自定义正负向词、否定词与程度副词,是提升效果的有效途径。
阈值调优:先以默认阈值运行,观察三类比例是否符合业务认知,再微调正负阈值使分类更贴合实际。
结果验证:随机抽检结果与人工判断的吻合度,对转折句、反讽句等典型误判修正词典。
趋势监测:按时间序列反复运行,结合“情感统计”观察正负向占比变化,用于舆情预警与口碑追踪。
平台界面

平台界面包含:数据上传区、情感词典与参数设置区、词典配置区、结果展示(情感得分、情感分布、情感词云)及 AI 分析模块
参考文献:
Liu, B. (2012). Sentiment Analysis and Opinion Mining. Morgan & Claypool.
Mohammad, S. M., & Turney, P. D. (2013). Crowdsourcing a Word-Emotion Association Lexicon. Computational Intelligence.