无效样本处理

方法概述

无效样本处理用于识别并剔除或标记数据集中质量低下的样本(行)。在实际采集的数据中,部分样本可能因大面积缺失、同一数值反复出现而缺乏信息价值,若保留将稀释有效信息并影响建模质量。本工具基于行内缺失比例行内相同数字比例两项指标判定样本有效性,两项阈值可独立启用或同时启用,支持剔除或新增标记列两种处理方式,并配套统计报告、散点图、柱状图与 AI 智能解读,适用于问卷数据、多指标采集记录及入库前的数据质检场景。

计算步骤

1. 数据加载与预处理

  • 文件读取:支持 CSV 和 Excel 格式,文件大小不超过 5MB。
  • 缺失识别:自动将常见缺失占位符(如 """NA""null""?" 等)统一转换为缺失值标记。
  • 列类型转换:对字符型列,若超过 80% 的值可转换为数值,则自动转为数值列;仅数值列参与无效样本统计。
  • 空行/列清理:删除完全为空的行和列。

2. 分析列选择

用户可选择参与判定的列(默认选择全部数值列),非数值列在统计时被忽略。

3. 无效样本判定指标

设某样本在所选列中的总列数为 \(n_c\)

  • 缺失比例:行内缺失数量 \(n_{NA}\) 与总列数之比,即

\[ r_{miss} = \frac{n_{NA}}{n_c} \]

  • 相同数字比例:行内众数(出现最频繁的数值)频数 \(f_{mode}\) 与有效数字个数 \(n_{valid}\)(非缺失取值数)之比,即

\[ r_{rep} = \frac{f_{mode}}{n_{valid}} \]

4. 判定规则与阈值

  • 两项筛选项均可独立启用或关闭,缺失比例阈值与重复比例阈值默认均为 80%,可在 0%-100% 内调整。
  • 当某行的 \(r_{miss}\) 超过缺失阈值,或 \(r_{rep}\) 超过重复阈值时,判定为无效样本。
  • 若两项同时启用,满足任一条件即视为无效样本。

5. 处理方式

  • 剔除无效样本:删除被判定为无效的行,保留其余样本。
  • 标记无效样本:新增标记列(Valid_Flag),无效样本标记为 Invalid,其余为 Valid,便于人工复核。

6. 统计报告与可视化

  • 统计汇总:总行数、有效样本数、无效样本数及各自比例。
  • 判定明细:前 10 行的有效性判定结果(行号与”是否无效”)。
  • 散点图:各样本的缺失比例与相同数字比例散点图,无效样本以红色区分。
  • 柱状图:有效与无效样本数量对比。
  • 显示设置:小数位数仅影响表格中的数值显示精度,不影响判定结果。

7. AI 智能分析

基于样本统计与阈值设置等摘要结果,调用大语言模型分析无效样本特征并给出处理建议(每日限 3 次,需配置 API 密钥)。

8. 结果导出

  • 下载处理后的数据(CSV 或 Excel)。
  • 下载包含统计汇总与处理后预览的 HTML 报告。

案例分析

案例背景:某问卷回收 100 条记录,含年龄、收入、评分、消费额 4 个数值指标,部分记录存在大面积缺失或取值高度重复,需识别并进行处理。

原始数据(示例)

记录ID 年龄 月收入 评分 消费额
1 28 8500 85 320
2 35 12000 92 480
3 NA NA NA NA
4 42 9999 99 99
5 31 7000 76 210

处理过程(示例)

  1. 加载数据:上传 CSV,全空白行(记录 3)自动识别为缺失。
  2. 参数设置:同时启用缺失比例与重复比例筛选,阈值均设为 80%,分析列选全部数值列。
  3. 指标计算
    • 记录 3:\(n_{NA}=4, n_c=4\)\(r_{miss}=100\%\),超过阈值,判定为无效。
    • 记录 4:\(r_{miss}=0\%\),但 \(r_{rep}=2/4=50\%\)……在本示例设置下未超阈值,判定为有效(若重复比例阈值降至 50% 以下则会被判为无效)。
  4. 处理方式:选择”剔除无效样本”,记录 3 被剔除。
  5. 效果评估:剔除后样本数由 100 降至 99(本示例仅列出单条无效记录),剩余记录缺失与重复状况明显改善。

处理结果统计(示例)

指标
总行数 100
有效样本数 99
无效样本数 1
无效比例 1%

结论:在本示例数据范围内,缺失比例筛除完全空白的记录,重复比例筛除取值高度一致的样本;两项阈值可灵活组合,实际有效样本数取决于所选阈值。

常见问题

Q1: 缺失比例和重复比例的计算分母为什么不同?
A: 缺失比例以所选总列数为分母,反映该行缺失的严重程度;相同数字比例以该行有效数字个数为分母,反映有效取值的信息重复程度,两者衡量不同维度的无效性。

Q2: 两项筛选同时启用时如何判定?
A: 满足任一启用条件即判定为无效样本(“或”逻辑)。若误删过多,可上调阈值或仅启用一项。

Q3: 标记方式相比剔除方式有什么好处?
A: 标记方式保留全部原始记录并新增有效性列,便于人工复核后再决定是否删除,避免误删。

Q4: 阈值设置多少合适?
A: 取决于数据质量。默认 80% 可识别明显无用的样本;若数据整体较规整,可适当调低阈值以捕捉轻微异常。

Q5: 为什么有时散点图中的点会聚集在边界附近?
A: 当某行缺失比例恰好等于阈值或相同数字比例接近 1 时,其位置会紧贴散点图边界,可通过调整阈值观察判定结果随之变化,辅助确定合理的筛选边界。

平台功能

  • 数据输入:支持 CSV、Excel(≤5MB),自动识别缺失符号并智能转换列类型。
  • 分析列选择:可指定参与判定的列,默认全部数值列。
  • 判定规则:缺失比例与相同数字比例两项筛选,可独立或同时启用,阈值 0%-100% 可调。
  • 处理方式:剔除无效样本或标记无效样本(新增标记列)。
  • 结果展示
    • 原始数据预览中无效样本行以红色背景标记。
    • 统计汇总表与判定明细表。
    • 缺失比例与相同数字比例散点图、有效/无效数量柱状图。
  • AI 智能分析:自动解读无效样本特征与阈值合理性(每日限 3 次,需配置 API 密钥)。
  • 报告下载:支持下载处理后数据(CSV/Excel)和分析报告(HTML)。

使用建议

  1. 先观察趋势:利用散点图查看缺失比例与重复比例分布,再确定阈值。
  2. 从默认阈值开始:先以 80% 阈值运行,观察无效样本数量,再按需调整。
  3. 谨慎删除:对重要业务数据建议先”标记”,人工复核确认后再剔除。
  4. 结合缺失值处理:若无效样本源于局部缺失,可先考虑用缺失值工具填充,而非直接删除。
  5. AI 辅助:配置 API 密钥后可让 AI 评估阈值合理性并提出改进方向。

平台界面

官方地址:https://superr.online

无效样本处理工具界面

平台界面包含:数据上传区、分析列与阈值参数区、原始数据预览(无效行红色标记)、统计汇总、散点图与柱状图及 AI 分析模块

参考文献

  1. Kim, J. K., & Jun, D. B. (2011). Hot-deck imputation and missing data. Journal of Statistical Planning and Inference, 141(4), 1503-1515.
  2. Little, R. J. A., & Rubin, D. B. (2019). Statistical Analysis with Missing Data (3rd ed.). Wiley.
  3. Zhu, X., & Wu, X. (2004). Class noise vs. attribute noise: A quantitative study. Artificial Intelligence Review, 22(3), 177-210.