文本切分

方法概述

文本切分(Text Splitting)按照指定规则将整段文本切分为若干片段,是文本结构化与预处理的基础工具。问卷开放题、访谈记录、产品说明等长文本通常需要切成短句或字段后才能进行后续统计与分析。本工具支持按空格、换行、标点、自定义分隔符及正则表达式等多种切分规则,并提供切分统计与可视化。

本工具核心能力:

  • 多规则切分:按空格、按换行、按标点切分可自由组合,支持自定义分隔符与正则表达式。
  • 灵活清洗:去除首尾空白、移除空元素、忽略大小写、最小片段长度过滤。
  • 来源追溯:每个片段保留原始文本、来源列/行与序号,方便回溯。
  • 统计可视化:切分统计、长度分布、高频片段与文本-片段数量关系图。

方法原理

文本切分的本质是按规则定位分隔位置并划分文本序列。核心思路是:给定分隔符集合 \(D\),从文本 \(T\) 中按字符扫描,遇到分隔符即在该位置切分,得到片段序列。本工具在基础切分上增加了清洗、过滤与来源追溯:

1. 分隔符定位

  • 按空格/换行:将空格、制表符、换行符视为边界,适合英文等以空格分词的语言。
  • 按标点:以中英文标点集合为边界切分长句为分句。
  • 自定义分隔符:以用户指定字符(如 \t)切分,并按字符转义处理避免正则歧义。
  • 正则表达式:以任意复杂模式(如”数字+冒号”)作为切分规则,灵活度最高。

2. 文本切分

对文本 \(T\) 按分隔符集合进行扫描切分,可表示为将序列划分为若干子串:

\[ T = s_1 \cdot s_2 \cdot \ldots \cdot s_n, \quad s_i \cap s_{i+1} = \emptyset \]

各规则可组合叠加,先按规则集切割再保留非空片段。

3. 清洗与过滤

  • 去除片段首尾空白。
  • 移除切分产生的空元素。
  • 按最小片段长度过滤过短碎片,避免大量单字符噪声。

4. 来源追溯与统计

每个片段记录原始文本、来源列/行与片段序号,保证可回溯;同时统计总文本数、总片段数、平均每文本片段数与长度分布,为评估切分质量提供依据。

使用流程

在平台左侧菜单选择“其他文本处理工具 → 文本切分”,点击“开始智算”进入工具界面:

Step 1 数据准备

  • 支持 CSV、Excel、TXT 三种格式,文件大小不超过 10MB。
  • CSV/Excel 为多列表格(默认取第一列);TXT 每行一条文本或完整文档。

Step 2 切分规则设置

  • 勾选切分方式:按空格(默认开)、按换行、按标点。
  • 或启用正则表达式模式,输入自定义分割规则(默认内置中英文标点集)。

Step 3 清洗与过滤

  • 设定自定义分隔符(默认 ,,自动转义)。
  • 选择去除首尾空白、移除空元素、忽略大小写。
  • 设定最小片段长度(默认 1)。

Step 4 开始分析

点击“开始切分”按钮,工具自动按所选规则完成片段切分。

Step 5 结果查看与下载

查看切分结果、切分统计、可视化分析等标签页,可下载完整结果(含多个工作表)、切分数据、统计数据与分析报告。

参数说明

参数 默认值 说明
数据列 第一列 参与切分的列(可多选)
按空格切分 以空白字符切分
按换行切分 以换行符切分
按标点切分 以中英文标点切分
使用正则表达式 启用自定义正则切割规则
自定义分隔符 , 手动指定分隔符(自动转义)
去除首尾空白 清理片段两侧空白
移除空元素 丢弃切分产生的空片段
忽略大小写 字符比较忽略大小写
最小片段长度 1 短于该长度的片段被过滤

案例分析

案例背景:对 500 条“多选”类问卷文本进行切分,将每条按分隔符合并拆分,统计选项分布。

  • 数据:Excel 文件,一列文本如“功能完善;价格适中;售后好”。
  • 参数:自定义分隔符 、去除首尾空白、移除空元素。

分析结果示例

  • 500 条文本共切分为 1430 个片段,平均每条 2.86 个选项。
  • 片段长度 2-6 字为主,高频片段集中在“价格”“功能”“售后”等选项词。

结论:切分结果快速还原出各选项的独立记录,为后续词频统计与选项分布分析提供了结构化数据。

常见问题

Q1: 空格与标点切分有何区别?

A: 按空格切分适合英文等以空格分词的语言;按标点切分可将长句拆为短分句;两者可组合使用以满足不同语料。

Q2: 为什么需要自定义分隔符?

A: 中文文本常以顿号、分号或制表符分隔字段,自定义分隔符可按业务格式精确切分。

Q3: 正则表达式模式适合什么场景?

A: 需要按复杂模式(如“数字+冒号”、“特定符号组合”)切分时使用,灵活度最高。

Q4: 切分结果如何追溯来源?

A: 结果表保留原始文本与来源列/行号、片段序号,可随时定位某一片段来自哪条记录。

平台功能

  • 数据输入:支持 CSV、Excel、TXT 格式,多列可勾选;文件大小限制 10MB。
  • 切分规则:空格、换行、标点、自定义分隔符、正则表达式组合使用。
  • 清洗过滤:去除首尾空白、移除空元素、忽略大小写、最小片段长度过滤。
  • 结果展示
    • 切分结果(原始文本/片段/来源列行/序号/长度)
    • 切分统计(总文本数、总片段数、平均每文本片段数、平均片段长度、长度分布、高频片段)
    • 可视化分析(每文本片段数量分布、文本长度与片段数量散点图)
  • 结果导出:完整结果(Excel 多表)、切分数据、统计数据、分析报告(HTML)。

使用建议

  1. 规则最小化:优先用最少的切分规则满足需求,避免过度切分破坏语义单元。

  2. 先看统计:利用长度分布与高频片段判断切分是否合理,再决定是否微调规则。

  3. 保留溯源:时刻留意来源列/行字段,方便对切分结果做人工抽查。

  4. 下游衔接:切分后的片段可直接输入分词、词频、AI 文本总结等工具,形成完整流水线。

  5. 正则谨慎:使用正则模式时先在少量数据上试切,确认分割结果符合预期再全量运行。

平台界面

官方地址:https://superr.online

文本切分工具界面预览

平台界面包含:数据上传区、切分规则设置区、清洗过滤选项、结果展示(切分结果、切分统计、可视化分析)及下载区


参考文献

  1. Friedl, J. E. F. (2006). Mastering Regular Expressions. O’Reilly Media.

  2. Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.