TSFMAudit:时间序列基础模型预训练数据污染审计
机器学习
2026-05-27 v1 人工智能
摘要
时间序列基础模型(TSFMs)越来越多地在大型语料库上进行预训练,这引发了评估数据集可能在预训练期间已被暴露的担忧,从而产生过于乐观的性能估计。在时间序列中审计此类污染具有挑战性,因为信号是连续且异质的,并且通常缺乏语料库文档。据我们所知,这是首个研究TSFMs预训练污染审计的工作。我们形式化了TSFMs的预训练污染审计问题,并提出了TSFMAudit,一种基于探针适应动力学的方法。我们的关键直觉是,污染表现为异常高效的适应:在微调探针之后,受污染的数据集倾向于以更小的骨干网络移动实现更快的损失降低。我们使用有文档记录的训练源证据作为监督,在6个TSFMs和187个数据集上评估了TSFMAudit,并与从LLM文献中改编的10个竞争基线进行了比较。
引用
@article{arxiv.2605.26161,
title = {TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models},
author = {Hongkai Li and Shifeng Xie and Lefei Shen and Zhuo Li and Mouxiang Chen and Xiaobin Zhang and Han Fu and Jianling Sun and Xiaoxue Ren and Chenghao Liu},
journal= {arXiv preprint arXiv:2605.26161},
year = {2026}
}
备注
22 pages, 7 figures, 9 tables