数据标准化/归一化

方法概述

数据标准化与归一化旨在消除各数值变量之间量纲与尺度差异,使其可比或满足特定统计假设,是聚类、回归、距离计算与机器学习建模前常用的一步。不同量纲的指标(如收入以”元”计、评分以”0-100”计)直接参与计算时,数值较大的变量往往主导结果,从而影响距离、权重与模型参数的稳定解读。

本工具提供 Min-Max 归一化、Z-score 标准化、稳健标准化、均值化、求和归一化、平方和归一化、最大绝对值缩放、中心化等常规方法,并支持 Box-Cox、Yeo-Johnson 与 Johnson 等正态性变换。所有方法都会自动生成变换参数表,记录变换所依据的统计量(如均值、标准差、\(\lambda\)),便于结果追溯、还原,以及用同一参数处理后续新增样本。

计算步骤

1. 数据加载与预处理

  • 支持 CSV 与 Excel 文件上传(不超过 5MB),并提供数据模板与算法文档下载。
  • 数据格式要求:第一行为列名,第二行起为观测值,缺失值可用常见符号标注或空缺。
  • 自动将常见缺失符号(NAnull? 等)转为缺失值;对文本列,若超过 80% 的值可转为数值,则自动转为数值列。
  • 删除完全为空的行和列;待标准化列需为数值型。

2. 选择标准化方法

用户可从下列方法中选择,并对所选列(按住 Ctrl 或 Shift 多选)批量执行:

  • Min-Max 归一化:将数据线性映射到区间 \([a,b]\)(默认 \([0,1]\),上下界可调): \[ x' = a + (b-a)\cdot\frac{x-\min(x)}{\max(x)-\min(x)} \]
  • Z-score 标准化:减去均值并除以标准差: \[ x' = \frac{x-\bar{x}}{\sigma} \]
  • 稳健标准化:以中位数为中心,按四分位距缩放,对异常值较稳健: \[ x' = \frac{x-\text{median}(x)}{IQR} \]
  • 均值化:除以均值,\(x' = \frac{x}{\bar{x}}\)
  • 求和归一化:除以总和,使各值之和为 1。
  • 平方和归一化:除以平方和开方,使向量长度(L2 范数)为 1:\(x' = \frac{x}{\sqrt{\sum x_i^2}}\)
  • 最大绝对值缩放:除以最大绝对值,将范围缩放到 \([-1,1]\)
  • 中心化:减去均值,\(x' = x - \bar{x}\)
  • Box-Cox 变换(要求全部为正): \[ x' = \begin{cases}\frac{x^\lambda - 1}{\lambda}, & \lambda\neq 0\\[2pt] \ln x, & \lambda = 0\end{cases} \] \(\lambda\) 可自定义或自动估计。
  • Box-Cox 逆变换:由变换值还原为原始尺度,需指定 \(\lambda\)
  • Yeo-Johnson 变换:允许非正值,推广了 Box-Cox 的适用范围。
  • Johnson 变换:通过参数族将数据变换为近似正态分布,可选择是否将结果进一步标准化(使均值为 0、方差为 1)。

3. 处理方式设置

  • 替换原列:用变换后的值覆盖原列。
  • 新增列:保留原列,在数据表末尾追加新列(后缀可自定义,留空时按方法自动生成,如 _z_mm_bc 等)。

4. 结果展示与可视化

  • 变换参数表:记录各列使用的关键参数,如 Min-Max 的最小/最大值与上下界、Z-score 的均值与标准差、正态变换的 \(\lambda\)(以及 Johnson 变换的参数族信息),便于追溯与还原。
  • 统计摘要:显示原始列数、处理列数、标准化方法与处理后列数。
  • 直方图对比:对所选第一列绘制变换前后的直方图对比。
  • 箱线图对比:分别绘制所选列处理前与处理后的箱线图,直观反映分布形态与离群程度变化。

5. AI 智能分析

基于标准化方法、处理列、处理方式等信息,调用大语言模型评估变换后数据的分布是否适宜建模,并给出后续建模策略建议(每日限 3 次,需配置 API 密钥)。

6. 结果导出

  • 下载处理后的数据(CSV 或 Excel)。
  • 下载包含变换参数与数据预览的 HTML 报告。

案例分析

案例背景:某调查数据包含”月收入(元)“与”满意度评分(0-100)“两个数值指标,两者量纲差异较大,需统一尺度后再进行综合比较。

原始数据(示例)

样本ID 月收入(元) 满意度评分
1 8500 85
2 12000 92
3 6000 78
4 20000 65
5 10000 88

处理过程:选择 Min-Max 归一化(区间 \([0,1]\)),对”月收入”和”满意度评分”两列执行”新增列”处理。

处理后数据(示例,数值四舍五入)

样本ID 月收入(元) 满意度评分 月收入_mm 满意度评分_mm
1 8500 85 0.179 0.852
2 12000 92 0.429 1.000
3 6000 78 0.000 0.556
4 20000 65 1.000 0.000
5 10000 88 0.286 0.926

结论:在本示例数据范围内,两列均映射到 \([0,1]\),原列保留便于对照;变换参数表记录了最小/最大值,可用于对后续新增样本执行一致的变换。

常见问题

Q1: Z-score 与 Min-Max 怎么选?
A: 若后续算法对数据分布或异常值较敏感,Z-score 更适用;若需将数据严格限定在某一区间(如 \([0,1]\)),优先选 Min-Max。两者均可由工具直接对比观察。

Q2: Box-Cox 变换要求数据为正,如何处理含非正值的列?
A: 此时工具会跳过该列并给出提示,可改用允许非正值的 Yeo-Johnson 变换,或先对数据做平移处理。

Q3: 变换参数表有什么用?
A: 用于记录变换所依据的统计量(如均值、标准差、\(\lambda\)),新数据接入时可沿用相同参数保持一致口径,便于结果可复现与还原。

Q4: “新增列”与”替换原列”有何区别?
A: 新增列保留原始值并追加变换结果,便于对照,但会增加数据列数;替换原列使数据更紧凑,但会覆盖原始信息。

Q5: 变换后出现缺失值正常吗?
A: 若原列存在缺失值,或所选方法对某些取值不适用(如均值化时均值恰为 0),对应位置会出现缺失值,可结合缺失值处理工具进一步处理。

Q6: 为什么同时提供直方图与箱线图对比?
A: 直方图反映整体分布形态,箱线图侧重反映离群与分散程度,两类图结合可更全面判断变换是否符合预期。

平台功能

  • 数据输入:支持 CSV、Excel,自动识别缺失符号、识别数值列、清理空行列;提供数据模板与方法介绍下载。
  • 标准化方法:Min-Max、Z-score、稳健、均值化、求和归一化、平方和归一化、最大绝对值、中心化共 8 种常规方法;Box-Cox、Box-Cox 逆变换、Yeo-Johnson、Johnson 共 4 种正态变换。
  • 处理方式:替换原列或新增列(后缀可自定义)。
  • 结果展示:变换参数表、统计摘要、变换前后直方图对比与箱线图对比。
  • AI 智能分析:评估分布并建议建模策略(每日限 3 次,需配置 API 密钥)。
  • 报告下载:处理后数据(CSV/Excel)与 HTML 报告。

使用建议

  1. 按需选择方法:聚类、距离计算常选 Z-score 或 Min-Max;回归前的偏态分布可选 Box-Cox 或 Yeo-Johnson。
  2. 核对量纲起点:Min-Max 受最小/最大值影响,若存在极端值,可先处理异常值再进行归一化。
  3. 善用对比图:借助箱线图与直方图对比确认变换效果,避免盲目选择方法。
  4. 保存变换参数:记录变换参数表,后续新数据接入时沿用同一套参数,保证口径一致。
  5. 先统一缺失与异常:建议先完成缺失值与异常值清洗,再进行标准化,可减少变换后的问题数据。
  6. 替换与新增并用:探索阶段可先用”新增列”保留原始值反复对比,确定了合适的标准化方案后再视需要替换原列。

平台界面

官方地址:https://superr.online

数据标准化/归一化工具界面

平台界面包含:数据上传区、标准化方法选择与参数设置区、处理方式设置、变换参数表、统计摘要、直方图/箱线图对比及 AI 分析模块

参考文献

  1. Box, G. E. P., & Cox, D. R. (1964). An analysis of transformations. Journal of the Royal Statistical Society, Series B, 26(2), 211-252.
  2. Yeo, I.-K., & Johnson, R. A. (2000). A new family of power transformations to improve normality or symmetry. Biometrika, 87(4), 954-959.
  3. Johnson, N. L. (1949). Systems of frequency curves generated by methods of translation. Biometrika, 36(1/2), 149-176.