中文

评估面向零样本时间序列预测的System 1 vs. 2推理方法:基准与洞见

机器学习 2025-03-17 v2 人工智能

摘要

推理能力是解决具有挑战性任务的关键。随着基础模型的发展,例如大型语言模型(LLM)的出现,一系列推理策略被提出,包括test-time增强措施,如Chain-ofThought,以及DeepSeek-R1中使用的后训练优化。在各种具有挑战性的语言或视觉任务中,这些推理策略已显示出有效性,但其在时间序列预测(TSF),特别是零样本TSF中的适用性和影响仍鲜有探讨。特别是,尚不清楚零样本TSF是否受益于推理,以及如果是这样,哪些类型的推理策略最有效。为填补这一差距,我们提出ReC4TS,首个系统评估流行推理策略在零样本TSF任务中效果的基准。ReC4TS覆盖八个领域的数据集,涵盖单模态和多模态,涉及短期和长期预测任务。更重要的是,ReC4TS提供了关键洞见:(1)自洽性(Self-consistency)成为最有效的test-time推理策略;(2)基于群体相对策略的优化在激励推理能力的后训练中更为合适;(3)多模态TSF比单模态TSF从推理策略中受益更多。除上述洞见外,ReC4TS建立了两个首创性起点为未来零样本TSF推理研究提供支持:(1)一个新的数据集TimeThinking,包含来自多个先进LLM标注的推理轨迹的预测样本;(2)一个基于自洽性推理策略验证的新的简单test-time scaling law,适用于基础TSF模型。所有数据和代码均公开可及于:https://github.com/AdityaLab/OpenTimeR。

关键词

引用

@article{arxiv.2503.01895,
  title  = {Evaluating System 1 vs. 2 Reasoning Approaches for Zero-Shot Time Series Forecasting: A Benchmark and Insights},
  author = {Haoxin Liu and Zhiyuan Zhao and Shiduo Li and B. Aditya Prakash},
  journal= {arXiv preprint arXiv:2503.01895},
  year   = {2025}
}