TSAQA:时间序列分析问答基准
人工智能
2026-02-02 v1
摘要
时间序列数据是金融、医疗、交通和环境科学等领域关键应用不可或缺的一部分。虽然最近的工作已经开始探索多任务时间序列问答(QA),但当前的基准仍然局限于预测和异常检测任务。我们引入了 TSAQA,这是一个新颖的统一基准,旨在拓宽任务覆盖范围并评估多样化的时间分析能力。TSAQA 在单一框架下整合了六种不同的任务,范围从常规分析(包括异常检测和分类)到高级分析(如特征描述、比较、数据转换和时间关系分析)。该数据集涵盖 13 个领域的 21 万个样本,采用多种格式,包括是非题(TF)、选择题(MC)和一种新颖的谜题(PZ),以全面评估时间序列分析。零样本评估表明,这些任务对当前的大型语言模型(LLM)具有挑战性:表现最好的商业 LLM Gemini-2.5-Flash 的平均得分仅为 65.08。尽管指令微调提升了开源模型的性能:表现最好的开源模型 LLaMA-3.1-8B 仍有很大的改进空间,这凸显了 LLM 进行时间分析的复杂性。
引用
@article{arxiv.2601.23204,
title = {TSAQA: Time Series Analysis Question And Answering Benchmark},
author = {Baoyu Jing and Sanhorn Chen and Lecheng Zheng and Boyu Liu and Zihao Li and Jiaru Zou and Tianxin Wei and Zhining Liu and Zhichen Zeng and Ruizhong Qiu and Xiao Lin and Yuchen Yan and Dongqi Fu and Jingchao Ni and Jingrui He and Hanghang Tong},
journal= {arXiv preprint arXiv:2601.23204},
year = {2026}
}
备注
35 pages, 7 figures