中文

TailedTS: 面向重尾时间序列预测与周期性量化的基准数据集

机器学习 2026-05-19 v1 人工智能 机器学习

摘要

我们提出了TailedTS,这是一个源自2024年维基百科每小时页面浏览量观测的大规模基准数据集,专门设计用于在重尾、零膨胀和非高斯条件下测试时间序列预测模型。该数据集包含约246.9亿个数据点,每月覆盖约300万个独特的维基百科页面,以高效的Apache Parquet格式存储。维基百科流量遵循显著的幂律分布,其中约5%的页面贡献了总浏览量的70%以上,这为模型在极端波动性下的鲁棒性提供了一个自然且严格的测试平台,而这种极端波动性在M4、M5和UCI电力数据集等现有基准中是不存在或代表性不足的。TailedTS支持多项研究任务。首先,我们引入了一个基于稀疏自回归(具有稀疏性和非负性约束)的周期性量化框架,揭示出高浏览量页面比低浏览量页面表现出显著更弱的周期结构,这对大型数字平台的服务器分配和流量预测具有直接影响。其次,我们提供了一套标准化的预测基准,在一系列非高斯损失函数(包括ℓ1范数、Huber、分位数和ℓp范数损失)下进行评估,表明标准的高斯估计器在高浏览量页面类别上性能显著下降,而鲁棒替代方法在所有流量规模上都能提供一致的性能提升。TailedTS公开可获取于https://doi.org/10.5281/zenodo.17070469。

关键词

引用

@article{arxiv.2605.16361,
  title  = {TailedTS: Benchmark Dataset for Heavy-Tailed Time Series Prediction and Periodicity Quantification},
  author = {Xinyu Chen and HanQin Cai and Lijun Ding and Jinhua Zhao},
  journal= {arXiv preprint arXiv:2605.16361},
  year   = {2026}
}