CaTS-Bench: 语言模型能否描述时间序列
机器学习
2026-05-04 v6 人工智能
计算机视觉与模式识别
摘要
时间序列描述是指将时间序列用自然语言描述,要求进行数值和时间推理、趋势解释以及情境理解。现有基准通常依赖完全合成或通用描述,通常忽略元数据和视觉表示。我们引入 CaTS-Bench,一个涵盖 11 个多样化领域的综合基准,核心为 1746 组人工重写描述的金标准评估集,用于衡量模型将数值趋势转化为可立即解读叙述的效果。为解决人工标注数据稀缺的问题,我们还提出了一个可扩展的高保真合成描述生成管道,并对其质量进行了验证。我们对领先的视觉-语言模型在本基准上的表现进行了评估,揭示即便是专有模型也难以捕捉数值细微差别的时间描述,而在合成数据上进行微调的开源模型可获得显著性能提升。最后,我们发布了一个包含 910 个多选题的诊断套件,并使用量身定制的数值指标来衡量时间序列特定推理能力,确立 CaTS-Bench 作为 grounded、多模态文本生成在数值领域可靠基础的基准。
引用
@article{arxiv.2509.20823,
title = {CaTS-Bench: Can Language Models Describe Time Series?},
author = {Luca Zhou and Pratham Yashwante and Marshall Fisher and Alessio Sampieri and Zihao Zhou and Fabio Galasso and Rose Yu},
journal= {arXiv preprint arXiv:2509.20823},
year = {2026}
}
备注
9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix