时序数据滑窗转换
方法概述
时序数据滑窗转换是将单变量时间序列重构为”过去若干时点 → 下一时点”的监督学习格式(即自回归形式),是时间序列预测与特征工程中常用的步骤。通过设定步阶(滞后期数)\(k\),工具以滑动窗口方式生成样本:每个样本由 \(k\) 个历史值 \(X_1,\dots,X_k\) 与当前目标 \(Y\) 组成。转换后的数据可直接用于滞后回归、机器学习预测建模或进一步的时序特征构造。
计算步骤
1. 数据加载与预处理
- 支持 CSV 与 Excel 文件上传(不超过 5MB),数据按时间顺序排列,首行为列名。
- 自动识别常见缺失符号并转为缺失值;对多数值可转换的文本列自动转为数值列。
- 删除完全空的行列;待转换的时间序列列需为数值型。
2. 设置滑窗参数
- 时序列:选择参与变换的数值列(单序列)。
- 步阶(滞后期数):\(k \geq 1\) 的正整数。步阶为 \(k\) 表示用 \(X_1=x_{t-k},\dots,X_k=x_{t-1}\) 预测 \(Y=x_t\)。
- 是否保留索引:可选择保留原始行号,或指定日期列作为索引,便于定位样本对应的时间点。
3. 执行滑窗转换
对长度为 \(n\) 的序列,构造滞后矩阵并生成样本:
\[ (X_1,\dots,X_k, Y) = (x_{t-k},\dots,x_{t-1}, x_t), \quad t = k+1,\dots,n \]
生成 \(n-k\) 个样本;选择删除含缺失值的行后,实际样本数可能进一步减少。
4. 转换摘要与可视化
- 统计信息:原始序列长度、步阶、转换后样本数、特征数(\(k\))与目标变量。
- 数据形状:转换后数据的行数与列数。
- 可视化:原始序列折线图、转换后 \(X_1\) 与 \(Y\) 的散点图(含线性趋势线)。
5. AI 智能分析
基于序列长度、步阶与样本数等信息,调用大语言模型分析滞后特征、评估当前步阶是否合适,并给出建模建议(每日限 3 次,需配置 API 密钥)。
6. 结果导出
- 下载转换后数据(CSV 或 Excel)。
- 下载包含摘要与可视化内容的 HTML 报告。
案例分析
案例背景:某门店记录了连续 10 天的日销售额,拟用前 2 天销售额预测当天销售额,构造滑窗训练数据。
原始数据(示例):
| 日期 | 日销售额(元) |
|---|---|
| 1月1日 | 5200 |
| 1月2日 | 5600 |
| 1月3日 | 5900 |
| 1月4日 | 6100 |
| 1月5日 | 6300 |
| 1月6日 | 6500 |
| 1月7日 | 6700 |
| 1月8日 | 7000 |
| 1月9日 | 7200 |
| 1月10日 | 7500 |
处理过程:选择”日销售额(元)“列,步阶设为 2,保留索引(日期列)。
转换后数据(示例):
| Index | X1 | X2 | Y |
|---|---|---|---|
| 1月3日 | 5200 | 5600 | 5900 |
| 1月4日 | 5600 | 5900 | 6100 |
| 1月5日 | 5900 | 6100 | 6300 |
| 1月6日 | 6100 | 6300 | 6500 |
| 1月7日 | 6300 | 6500 | 6700 |
| 1月8日 | 6500 | 6700 | 7000 |
| 1月9日 | 6700 | 7000 | 7200 |
| 1月10日 | 7000 | 7200 | 7500 |
结论:在本示例数据范围内,10 个时点的序列在步阶 2 下生成 8 个样本,\(X_1\) 与 \(Y\) 呈现正向关系,转换结果可作为后续预测建模的输入。
常见问题
Q1: 步阶(滞后期数)如何选择?
A: 初选 \(k=1\) 或 \(2\) 观察效果,再结合业务周期(如日/周/月季节性)调整;也可借助散点图与 AI 分析辅助判断。
Q2: 为什么样本数小于原始序列长度?
A: 每个样本需要 \(k\) 个历史值作为特征,序列前 \(k\) 个时点无法形成完整样本,样本数约等于 \(n-k\)(删除缺失行后可能更少)。
Q3: 缺失值如何处理?
A: 工具默认删除含缺失值的样本行;若缺失较多,建议先用缺失值处理工具填充后再做滑窗转换。
Q4: 索引列必须指定吗?
A: 不必。可仅保留行号索引;若指定日期列,便于在下游分析中对应到具体时间点。
Q5: 支持多变量时序吗?
A: 本工具针对单列时间序列生成滑动窗口特征;多变量可逐列转换后自行拼接,或用其它特征工程流程处理。
平台功能
- 数据输入:支持 CSV、Excel,按时间顺序排列;自动识别缺失符号与数值列;提供数据模板与方法介绍下载。
- 滑窗参数:时序列选择、步阶设置(正整数)、索引保留(行号或指定日期列)。
- 结果展示:转换摘要(原始长度、样本数、特征数)、数据形状、原始序列折线图与 \(X_1\)-\(Y\) 散点图。
- AI 智能分析:评估滞后特征与步阶合理性并给出建模建议(每日限 3 次,需配置 API 密钥)。
- 报告下载:转换后数据(CSV/Excel)与 HTML 报告。
使用建议
- 确保时序有序:按时间顺序排列后再上传,避免窗口打乱时间逻辑。
- 先补缺失再滑窗:滑窗前处理缺失值可保留更多有效样本。
- 结合业务周期设阶:存在 7 日周期时可考虑从 \(k=7\) 附近探索步阶。
- 观察散点图:借助 \(X_1\)-\(Y\) 散点图判断滞后关系形态,据此选择模型。
- 明确训练/预测口径:转换后保留索引,方便后续按时间拆分训练集与测试集。
平台界面

平台界面包含:数据上传区、步阶与索引设置区、转换摘要与数据形状、原始序列图与散点图、AI 分析模块及下载区
参考文献
- Box, G. E. P., Jenkins, G. M., Reinsel, G. C., & Ljung, G. M. (2015). Time Series Analysis: Forecasting and Control (5th ed.). Wiley.
- Hyndman, R. J., & Athanasopoulos, G. (2021). Forecasting: Principles and Practice (3rd ed.). OTexts.