数据标签
方法概述
数据标签工具用于在文字类别与数字标签之间进行双向转换:既可把”性别(男/女)、地区(华东/华北…)“等定类文字转换为 1、2、3 等数字标签,也可依据已有对应关系将数字标签还原为原始文字。相比通用编码,本工具着重于标签”对应关系”的管理:生成时自动产出标签对应表,还原时可使用自动保存的对应表或手动上传的外部映射表,保证标签在数据集间、数据集内部与上下游环节中口径一致。
计算步骤
1. 数据加载与预处理
- 支持 CSV 与 Excel 文件上传(不超过 5MB),自动识别常见缺失符号并转为缺失值,删除完全空的行列。
- 自动识别数据中的文本(类型枚举)列与数值列,为后续模式选择提供可用列清单。
2. 选择操作模式
- 生成数字标签(文字→数字):选择文本/类型枚举列,按字母顺序或出现频率降序为各类别分配数字: \[ \text{label}(c_i) = i, \quad i=1,2,\dots,k \]
- 还原文字标签(数字→文字):选择数值列,使用以下任一映射表还原为文字:
- 自动保存的对应表:同一流程中先生成标签后自动保留的映射关系。
- 手动上传映射表(CSV):文件需包含”数字标签”与”原始值”两列;若含”列名”列则按各列分别匹配映射,否则作为默认映射应用于所有所选列。
3. 处理方式设置
- 替换原列:用结果覆盖原列。
- 新增列:保留原列并追加结果(生成模式后缀
_label,还原模式后缀_original)。
4. 结果展示
- 标签对应表:逐列展示原始值与数字标签的对应关系(含”对应关系”列,如”男 ↔︎ 1”)。
- 统计报告:生成模式下展示各变量的标签(类别)数量及操作类型;还原模式展示还原的变量列表。
- 可视化:生成模式下绘制各变量标签数量柱状图。
5. AI 智能分析
基于处理变量数、类别数或还原变量数等信息,调用大语言模型分析标签分布并提出后续分析建议(每日限 3 次,需配置 API 密钥)。
6. 结果导出
- 下载操作后数据(CSV 或 Excel)。
- 下载包含标签对应表与数据预览的 HTML 报告。
案例分析
案例背景:某用户画像数据中的”性别”“婚姻状况”为文字类别,需生成数字标签用于建模;另有一份已标签化数据需还原为文字以便业务解读。
原始数据(示例):
| 用户ID | 性别 | 婚姻状况 |
|---|---|---|
| 001 | 男 | 已婚 |
| 002 | 女 | 未婚 |
| 003 | 男 | 离异 |
| 004 | 女 | 已婚 |
处理过程:选择生成数字标签,按字母顺序为”性别”与”婚姻状况”分配数字(女/未婚编号靠前)。
标签对应表(示例):
| 变量名 | 原始值 | 数字标签 | 对应关系 |
|---|---|---|---|
| 性别 | 女 | 1 | 女 ↔︎ 1 |
| 性别 | 男 | 2 | 男 ↔︎ 2 |
| 婚姻状况 | 未婚 | 1 | 未婚 ↔︎ 1 |
| 婚姻状况 | 已婚 | 2 | 已婚 ↔︎ 2 |
| 婚姻状况 | 离异 | 3 | 离异 ↔︎ 3 |
结论:在本示例数据范围内,两列文字类别被转换为数字标签,生成的对应表记录了全部映射关系,可用于后续还原与跨数据集统一口径。
常见问题
Q1: 标签顺序按字母或频率有何区别?
A: 按字母顺序的编号稳定、可预期;按频率降序让高频类别编号靠前,便于观察分布。不同顺序仅影响编号,不影响类别本身。
Q2: 还原标签时必须先在本工具生成吗?
A: 不一定。生成后工具自动保存对应表;也可以手动上传满足”数字标签+原始值”(可选含”列名”)格式的外部映射表进行还原。
Q3: 数字标签能还原为原来的文字吗?
A: 能。在还原模式下依据对应表将数字标签映射回原始文字;未在映射表中的数值会转为缺失值,建议先检查映射覆盖范围。
Q4: 不同列需要不同的对应表怎么办?
A: 手动上传的映射表若含”列名”列,工具会按各列名分别匹配映射;不含”列名”列时作为默认映射应用于所有所选列。
Q5: “替换原列”还是”新增列”?
A: 替换原列使数据紧凑;新增列(_label/_original)保留两种形式便于对照,数据列数会相应增加。
平台功能
- 数据输入:支持 CSV、Excel,自动识别缺失符号、清理空行列;自动识别文本/类型枚举列与数值列;提供数据模板与方法介绍下载。
- 两种模式:生成数字标签(文字→数字)与还原文字标签(数字→文字),均支持替换或新增列。
- 映射表管理:生成自动保存对应表;还原时可使用已保存表或手动上传 CSV 映射表(支持按列名分派或默认映射)。
- 结果展示:标签对应表(原始值 ↔︎ 数字标签)、统计报告(类别数/操作类型)、标签数量柱状图。
- AI 智能分析:分析标签分布并给出后续分析建议(每日限 3 次,需配置 API 密钥)。
- 报告下载:操作后数据(CSV/Excel)与 HTML 报告。
使用建议
- 先确认取值集合:生成前查看列的类别数量与取值,避免遗漏类别导致标签不稳定。
- 维护对应表档案:妥善保存生成或上传的对应表,保证同一变量在不同数据集间编号一致。
- 核查还原覆盖:还原前检查映射表是否覆盖所选列的全部数值,避免出现无法还原的缺失。
- 按需选择附加列:需要对照或继续使用文字值时选择”新增列”,仅需数值时选择”替换原列”。
- 结合编码工具:若需独热、目标等更丰富的编码方式,可转用”数据编码”工具。
平台界面

平台界面包含:数据上传区、操作模式与列选择、映射表来源设置(已保存/手动上传)、标签对应表、统计报告、标签数量柱状图及 AI 分析模块
参考文献
- Agresti, A. (2013). Categorical Data Analysis (3rd ed.). Wiley.
- Pedhazur, E. J. (1997). Multiple Regression in Behavioral Research: Explanation and Prediction (3rd ed.). Wadsworth.