中文

创建一种用于评估AI模型时间序列预测鲁棒性的因果基础评分方法

机器学习 2026-01-28 v3 人工智能

摘要

AI模型,包括专门针对时间序列的模型和通用基础模型(FMs),已在金融等各个领域的时间序列预测中展示了强大的潜力。然而,这些模型对输入扰动高度敏感,可能导致预测错误并削弱利益相关者(包括投资者和分析师)的信任。为应对这一挑战,我们提出了一种因果基础的评估框架,通过分析各种噪声和错误输入场景下的统计偏差和混淆偏差,系统地评估模型鲁棒性。我们的框架应用于涉及多个行业股价数据的大规模实验设置,并评估了单模态和多模态模型,包括基于Vision Transformer(ViT)的模型和FMs。我们引入了六种输入扰动类型和十二种数据分布来评估模型性能。结果表明,多模态和时间序列专用FMs相比通用模型展现出更大的鲁棒性和准确性。此外,为验证我们框架的可用性,我们进行了一项用户研究,展示了时间序列模型的预测错误以及我们计算的评分。该研究证实,我们的评分降低了用户在比较不同模型鲁棒性时的难度。我们的发现可以帮助利益相关者理解模型在鲁棒性和准确性方面的行为,从而做出更好的决策,即使在没有访问模型权重和训练数据的情况下,即黑箱设置。

关键词

引用

@article{arxiv.2502.12226,
  title  = {Creating a Causally Grounded Rating Method for Assessing the Robustness of AI Models for Time-Series Forecasting},
  author = {Kausik Lakkaraju and Rachneet Kaur and Parisa Zehtabi and Sunandita Patra and Zhen Zeng and Siva Likitha Valluru and Biplav Srivastava and Marco Valtorta},
  journal= {arXiv preprint arXiv:2502.12226},
  year   = {2026}
}

备注

arXiv admin note: text overlap with arXiv:2406.12908