英文情感分析

方法概述

英文情感分析(English Sentiment Analysis)是对英文文本所表达的情感倾向(正向、负向或中性)进行识别与度量的文本挖掘方法,广泛用于产品评论、社交媒体舆情、用户反馈分析等场景。

本工具基于情感词典匹配完成分析,核心特点包括:

  • 内置情感词典:AFINN、Bing、NRC 三种主流英文情感词典,可选择使用或完全自定义。
  • 自定义情感词典:可上传或直接输入正向词、负向词、否定词与程度副词。
  • 否定词处理:如 “not、never”,可翻转词语情感极性。
  • 程度副词处理:如 “very、extremely”,可增强或减弱情感强度。
  • 词形处理:支持小写化、词干提取、词性还原与停用词过滤等预处理。
  • 通过正向/负向分类阈值判定文本最终情感类别,输出情感分布、高频情感词与正/负向情感词云。

界面支持中英文双语切换

方法原理

基于词典的情感分析(Lexicon-based Sentiment Analysis)通过匹配情感词典中的词语并对情感得分进行聚合,判断文本的情感倾向。以常见的 Bing 二值词典AFINN 带权词典为例,核心步骤如下:

1. 词典与权重

  • Bing 词典:将词语分为正向(+1)与负向(-1)两类。
  • AFINN 词典:为每个词赋予 -5 至 +5 的权重值,体现情感强弱。
  • NRC 词典:标注词的八大情绪与正负极。

2. 预处理与词形处理

对小写化、词干提取或词性还原后的文本进行停用词过滤,保留候选情感词序列 \(w_1, w_2, \dots, w_m\)

3. 情感得分计算

逐词匹配词典计算得分。设第 \(i\) 个词前最近的程度副词强度为 \(d_i\),否定词出现由 \(n_i \in \{0,1\}\) 表示(出现则翻转极性),则文本整体情感得分为:

\[ \text{Score} = \sum_{i=1}^{m} (-1)^{n_i} \times d_i \times p(w_i) \]

其中 \(p(w_i)\) 为该词在词典中的情感分值,\((-1)^{n_i}\) 实现否定翻转,\(d_i\) 实现程度加权。

4. 情感分类

设正向分类阈值为 \(t_+\)、负向分类阈值为 \(t_-\),则:

\[ \text{类别} = \begin{cases} \text{Positive} & \text{Score} > t_+ \\ \text{Negative} & \text{Score} < t_- \\ \text{Neutral} & t_- \le \text{Score} \le t_+ \end{cases} \]

5. 结果统计

汇总各文本情感类别与得分,输出情感分布、高频情感词及正向/负向情感词云。

使用流程

在平台左侧菜单选择“英文文本分析 → 英文情感分析”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 文件:第一列为文本内容;TXT 文件:每行一个文本段落。

Step 2 参数设置

  • 选择情感词典(AFINN / Bing / NRC / 自定义)。
  • 设置正向分类阈值(默认 0.1)与负向分类阈值(默认 -0.1)。
  • 设置最小词语长度,选择是否考虑否定词考虑程度副词内容去重去除停用词小写化词干提取词性还原

Step 3 高级设置(词典配置)

  • 正向词词典 / 负向词词典:上传文件或直接输入词语(每行一个)。
  • 否定词表:上传或输入 “not、never、no” 等。
  • 程度副词表:上传或输入 “very、extremely、slightly” 等。

Step 4 开始分析

点击“开始情感分析”按钮执行分析。

Step 5 结果查看与下载

查看情感分析结果、词语情感分析、情感统计、高频情感词、正向/负向情感词云等标签页,并下载结果。

参数说明

参数 默认值 说明
情感词典选择 Bing AFINN / Bing / NRC / 自定义
正向分类阈值 0.1 情感得分高于该值判为正向(0-1)
负向分类阈值 -0.1 情感得分低于该值判为负向(-1-0)
最小词语长度 2 参与情感计算的词语最小长度(1-10)
考虑否定词 识别并翻转否定修饰词语的情感极性
考虑程度副词 识别程度副词并调节情感强度
内容去重 对重复文本去重后再分析
去除停用词 去除高频无意义词
转换为小写 / 词干提取 / 词性还原 词形处理选项
正向/负向/否定词/程度副词词典 内置 可上传或直接输入自定义词典

案例分析

案例背景:对 300 条英文外卖评论进行情感分析。

  • 数据:CSV(第一列为评论文本)。
  • 参数:Bing 词典、正阈值 0.1、负阈值 -0.1,开启否定词与程度副词处理,小写化。

示例文本情感得分

评论 情感得分 情感类别
The food is excellent and delivery is fast 0.45 正向
Very disappointed, food arrived cold -0.38 负向
Not bad, but nothing special 0.04 中性
Great taste but poor packaging 0.11 正向

其中 “Very disappointed” 中程度副词 “very” 放大负面强度,被正确判为负向;“Not bad” 中否定词 “not” 翻转 “bad” 的极性,接近中性,符合语义。

情感分布统计示例:正向 161 条(54%)、负向 89 条(30%)、中性 50 条(16%)。

结论:工具反映了正负向评论分布,并通过否定词与程度副词处理识别了 “Not bad”“Very disappointed” 等带复杂修饰的表达。

常见问题

Q1: AFINN、Bing、NRC 三种词典有何区别?

A: AFINN 为带权分值词典(-5~5),能反映情感强弱;Bing 将词分为正负两类二值词典;NRC 提供八大情绪与正负极二维标签。三者在覆盖与评分方式上各有侧重,可对比选择。

Q2: 为什么 “not good” 被判为负向?

A: “good” 为正向词,被否定词 “not” 修饰后极性翻转,因此 “not good” 计为负向,这正是“考虑否定词”的作用。

Q3: 自定义词典与内置词典可以并用吗?

A: 选择“自定义”时会以自定义词典为准;选择内置词典时也可在“高级设置”上传补充正向词、负向词等,工具会自动合并。

Q4: 词干提取会影响情感判断吗?

A: 可能。词干提取会把 “disappointment” 变为 “disappoint” 等形式,若词典收录形式不一致会影响匹配,一般建议使用词性还原或关闭词形处理以保证匹配准确。

Q5: 如何提升领域准确性?

A: 补充业务领域(餐饮、医疗、金融)的正负向词与程度副词词典,并针对典型误判样本微调阈值,可获得较明显效果提升。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式,文件大小限制 10MB。
  • 参数设置:情感词典选择、正负阈值、最小词长、否定词/程度副词/去重/去停用词/词形处理开关。
  • 自定义词典:正向词、负向词、否定词、程度副词文件上传或直接输入。
  • 双语界面:中英文一键切换。
  • 结果展示:情感分析原理说明、情感分析结果(逐条得分与类别)、词语情感分析、情感统计、高频情感词、正向/负向情感词云。
  • 结果导出:下载情感分析明细、统计结果与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型自动解读情感分布,提供口碑分析建议(每日限 3 次)。

使用建议

  1. 预处理:务必开启去停用词并做小写化;是否启用词性还原可视词典匹配情况而定。

  2. 词典本地化:针对业务领域补充自定义正负向词、否定词与程度副词,是提升效果的有效途径。

  3. 阈值调优:先以默认阈值运行,观察三类比例是否符合业务认知,再微调正负阈值使分类更贴合实际。

  4. 结果验证:随机抽检结果与人工判断的吻合度,对转折句、反讽句等典型误判修正词典。

  5. 趋势监测:按时间序列反复运行,结合“情感统计”观察正负向占比变化,用于舆情预警与口碑追踪。

平台界面

官方地址:https://superr.online

英文情感分析工具界面

平台界面包含:数据上传区、情感词典与参数设置区、词典配置区、结果展示(情感得分、情感分布、情感词云)及 AI 分析模块

参考文献

  1. Liu, B. (2012). Sentiment Analysis and Opinion Mining. Morgan & Claypool.

  2. Mohammad, S. M., & Turney, P. D. (2013). Crowdsourcing a Word-Emotion Association Lexicon. Computational Intelligence.