英文网络分析

方法概述

英文网络分析(English Network Analysis)通过对文本中词语(或作者、文献等实体)之间的共现与关系进行建网分析,揭示文本背后的关系结构与话题组织模式,广泛用于科技文献计量、舆情话题传播、合作关系分析等场景。

本工具提供完整的“建网 → 测度 → 找团 → 可视化”流程:

  • 网络类型:词共现网络、语义网络、作者合作网络、引用网络、自定义网络。
  • 共现窗口:文档内、滑动窗口、句子内。
  • 边权重计算:共现次数、PMI、Jaccard 系数、余弦相似度。
  • 网络指标:节点度、介数中心性、接近中心性、网络密度、聚类系数等。
  • 社区发现:多种社区发现算法,支持子群分析。
  • 可视化:力导向、圆形、层次、Kamada-Kawai、随机等布局,节点大小/颜色可基于度与中心性映射。

界面支持中英文双语切换

方法原理

网络分析(Network Analysis)将文本中的实体(词语、作者、文献)作为节点,实体间关系(共现、合作、引用)作为边,构建关系网络图,并通过图论指标揭示结构特征。核心环节如下:

1. 网络构建

  • 词共现:统计词语在文档内、滑动窗口或句子内的共现次数,构造节点-边网络。
  • 边权重:除共现次数外,可用 PMI(点互信息)、Jaccard 系数、余弦相似度度量词对关联强度,其中 PMI 定义为: \[ \text{PMI}(x, y) = \log\frac{P(x, y)}{P(x)P(y)} \] PMI 抑制”高频但泛搭配”的词对,突出真正的语义关联。
  • 依据最小词频与最小边权重过滤低频节点与弱边,控制网络规模。

2. 网络指标计算

  • 节点度(Degree)\(k_i = \sum_j A_{ij}\),其中 \(A\) 为邻接矩阵,度量节点直接邻居数量。
  • 介数中心性(Betweenness):节点位于其他节点对最短路径上的比例,反映”枢纽”地位: \[ B(v) = \sum_{s \neq v \neq t} \frac{\sigma_{st}(v)}{\sigma_{st}} \] 其中 \(\sigma_{st}\)\(s\)\(t\) 的最短路径总数,\(\sigma_{st}(v)\) 为经过 \(v\) 的路径数。
  • 接近中心性(Closeness):节点到所有其他节点最短距离之和的倒数,反映信息可达的便捷程度。
  • 网络密度 / 聚类系数:整体连边稀疏程度与局部集聚程度。

3. 社区发现

通过社区发现算法(如模块度优化)将网络划分为若干社区,使社区内部连边稠密、社区之间连边稀疏。模块度 Q 衡量社区划分质量:

\[ Q = \frac{1}{2m} \sum_{ij} \left( A_{ij} - \frac{k_i k_j}{2m} \right) \delta(c_i, c_j) \]

Q 值越高,社区结构越清晰。

4. 可视化

借助力导向、圆形、层次等布局算法确定节点坐标,节点大小/颜色按度与中心性映射,直观展示网络结构与社区分布。

使用流程

在平台左侧菜单选择“英文文本分析 → 英文网络分析”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • 常规文本:第一列为原始文本、第二列为分词结果(空格分隔);TXT 每行一个文本。
  • 自定义网络:三列格式,源节点、目标节点、权重(可选)。
  • 选择网络类型(词共现 / 语义 / 作者合作 / 引用 / 自定义)并设置最小词频与最小边权重。

Step 2 网络构建

  • 选择共现窗口类型(文档内 / 滑动窗口 / 句子内)与窗口大小。
  • 选择是否构建有向网络,选择边权重计算方式(共现次数 / PMI / Jaccard / 余弦相似度)。
  • 设置最大节点数与最大边数。

Step 3 网络分析

  • 选择网络布局算法(力导向 / 圆形 / 层次 / Kamada-Kawai / 随机)。
  • 选择社区发现算法、随机种子,设置节点大小与颜色基于的指标、颜色方案。

Step 4 高级设置

  • 上传停用词文件;选择移除孤立节点、标准化中心性指标、显示详细过程。

Step 5 开始分析

点击“开始网络分析”按钮执行建网与分析。

Step 6 结果查看与下载

查看网络分析原理、网络可视化、网络指标、社区分析与子群分析等标签页,并下载结果。

参数说明

参数 默认值 说明
网络类型 词共现网络 词共现 / 语义 / 作者合作 / 引用 / 自定义
最小词频 2 低于该词频的词语不参与建网
最小边权重 2 低于该权重的边被剔除
共现窗口类型 文档内 文档内 / 滑动窗口 / 句子内
窗口大小 5 滑动窗口长度(3-20)
有向网络 是否构建有向网络
边权重计算 共现次数 共现次数 / PMI / Jaccard / 余弦相似度
最大节点数 / 最大边数 100 / 500 网络规模上限
网络布局算法 力导向布局 力导向 / 圆形 / 层次 / Kamada-Kawai / 随机
社区发现算法 多种社区发现算法可选
节点大小 / 颜色 基于度等指标 可基于度、中心性等映射
移除孤立节点 删除无边节点
标准化中心性指标 对中心性指标做标准化

案例分析

案例背景:对 250 篇 AI 领域英文论文摘要构建关键词共现网络。

  • 数据:CSV(摘要文本、分词结果)。
  • 参数:词共现网络、文档内窗口、边权重=共现次数、最大节点 80、最大边 500、力导向布局、社区发现。

分析结果示例

  • 核心节点:“deep learning、neural network、reinforcement learning、NLP” 位于网络中心。
  • 社区结构:识别出 4 个主要社区——深度学习与视觉、语言模型与 NLP、强化学习与机器人、数据挖掘与推荐。
  • 网络指标示例:网络密度 0.17、平均聚类系数 0.61,“deep learning” 介数中心性排名第一。

结论:共现网络展示了 AI 研究的四大主题群落,中心性指标可辅助识别领域枢纽术语,为研究趋势判断提供参考。

常见问题

Q1: 与主题分析(LDA)有何区别?

A: LDA 输出文档-主题概率分布;网络分析直接刻画词与词的共现拓扑(中心性、社区等)。两者互补:聚类/主题分群,网络展示关系结构。

Q2: 滑动窗口与文档内共现有何区别?

A: 文档内共现统计同一文档中的词对;滑动窗口共现限定在相邻窗口范围内,能刻画更局部的邻近关系。

Q3: 边权重计算方式有何区别?

A: 共现次数直接统计频次;PMI 度量共现强度相对期望的偏离,抑制高频泛搭配的对;Jaccard 与余弦从集合/向量角度度量关联。

Q4: 什么是有向网络?

A: 有向网络的边有方向(如引用 A→B),信息流动不对称;词共现通常为无向。选择有向后中心性会区分入度/出度。

Q5: 如何判断社区划分是否合理?

A: 结合模块度(Q 值)与社区内标签一致性判断,也可尝试不同社区发现算法对比。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式,文本类型与自定义网络(源/目标/权重)均可;文件大小限制 10MB。
  • 网络构建:网络类型、共现窗口、有向网络、边权重计算、节点/边规模控制。
  • 网络分析:布局算法、社区发现、随机种子、节点大小/颜色映射、颜色方案、孤立节点处理、中心性标准化。
  • 双语界面:中英文一键切换。
  • 结果展示:网络分析原理说明、网络可视化、网络指标统计表、社区分析、子群分析。
  • 结果导出:下载完整结果、GEXF 网络文件、网络指标与分析报告(HTML)。
  • AI 智能分析:基于 DeepSeek 大模型对网络结构与中心性自动解读(每日限 3 次)。

使用建议

  1. 预处理质量:先经“英文文本分词”分词并去停用词,避免 “the、and” 等成为高频中心节点。

  2. 规模控制:语料较大时设置合理的最大节点数与最大边数,保留核心结构、降低复杂度。

  3. 参数组合:一般先用“词共现 + 文档内 + 共现次数”快速建模,再用滑动窗口或 PMI 细化;有向关系(引用、关注)才选有向网络。

  4. 结果解读:结合“网络指标”找枢纽词、结合“社区分析”找主题群落、结合“网络可视化”直观展示,三者互为印证。

  5. 导出应用:网络指标与分析报告可用于论文;GEXF 文件可在 VOSviewer 或 Gephi 中进一步精细化可视化,配合“VOSviewer 可视化”工具使用。

平台界面

官方地址:https://superr.online

英文网络分析工具界面

平台界面包含:数据上传区、网络构建设置区、网络分析设置区、结果展示(网络可视化、网络指标、社区分析、子群分析)及 AI 分析模块

参考文献

  1. Newman, M. E. J. (2010). Networks: An Introduction. Oxford University Press.

  2. Blondel, V. D., et al. (2008). Fast Unfolding of Communities in Large Networks. J. Stat. Mech.