中文

TS-Skill:用于评估时间序列问答中分析技能的基准

计算与语言 2026-05-26 v1 人工智能

摘要

大型语言模型(LLMs)和时间序列语言模型(TSLMs)正在日益增多地应用于时间序列问答(TSQA)。不同于文本-only QA,TSQA 需要模型将答案 grounding 在可能在不同尺度、特定时间位置或跨越分离区间的模式出现的时序信号上。然而,现有的基准通常按任务类型或高层推理类别组织,难以诊断驱动模型性能的底层信号水平能力。我们引入 TS-Skill,一个用于评估 TSQA 中三种可组合分析技能的受控基准:时间尺度选择(SK1)、时间局部化(SK2)和跨区间集成(SK3)。TS-Skill 提供时间戳感知的问题、广泛的领域覆盖以及经人类验证的 QA 质量。为大规模构建基准,我们开发了 SKEvol,一个结合领域感知的时间序列种子生成、技能控制的问题生成、元数据和代码辅助答案构建、多阶段信号 grounding 验证以及人类参与式精选的技能引导智能体框架。在十个最先进的 LLMs 和 TSLMs 上的实验揭示了 SK1-SK3 之间存在显著且不均衡的能力差距。特别是,SK3 在非智能体模型中始终具有持久的挑战性,而工具增强型智能体在独立 SK3 上显示出选择性优势。这些发现表明,技能水平的评估可以揭示被聚合 TSQA 分数掩盖的时序推理故障。

关键词

引用

@article{arxiv.2605.24703,
  title  = {TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering},
  author = {Liying Han and Kang Yang and Oliver Wang and Jason Wu and Pengrui Quan and Gaofeng Dong and Ozan Baris Mulayim and Sizhe Ma and Yuyang Yuan and Dezhi Hong and Mario Berges and Mani Srivastava},
  journal= {arXiv preprint arXiv:2605.24703},
  year   = {2026}
}