中文

CaTS-Bench: 语言模型能否描述时间序列

机器学习 2026-05-04 v6 人工智能 计算机视觉与模式识别

摘要

时间序列描述是指将时间序列用自然语言描述,要求进行数值和时间推理、趋势解释以及情境理解。现有基准通常依赖完全合成或通用描述,通常忽略元数据和视觉表示。我们引入 CaTS-Bench,一个涵盖 11 个多样化领域的综合基准,核心为 1746 组人工重写描述的金标准评估集,用于衡量模型将数值趋势转化为可立即解读叙述的效果。为解决人工标注数据稀缺的问题,我们还提出了一个可扩展的高保真合成描述生成管道,并对其质量进行了验证。我们对领先的视觉-语言模型在本基准上的表现进行了评估,揭示即便是专有模型也难以捕捉数值细微差别的时间描述,而在合成数据上进行微调的开源模型可获得显著性能提升。最后,我们发布了一个包含 910 个多选题的诊断套件,并使用量身定制的数值指标来衡量时间序列特定推理能力,确立 CaTS-Bench 作为 grounded、多模态文本生成在数值领域可靠基础的基准。

关键词

引用

@article{arxiv.2509.20823,
  title  = {CaTS-Bench: Can Language Models Describe Time Series?},
  author = {Luca Zhou and Pratham Yashwante and Marshall Fisher and Alessio Sampieri and Zihao Zhou and Fabio Galasso and Rose Yu},
  journal= {arXiv preprint arXiv:2509.20823},
  year   = {2026}
}

备注

9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix