中文

ARFBench:用于软件事件响应的时间序列问答基准

机器学习 2026-05-04 v2 计算机视觉与模式识别

摘要

时间序列问答 (TSQA) 是指通过自然语言提问来推理和推断时间序列属性的能力,这是一种有前景却鲜有人探索的基础模型能力。本文提出 ARFBench,一个评估多模态基础模型在软件事件数据中常见时间序列异常方面理解能力的 TSQA 基准。ARFBench 包含 750 个问题,覆盖 142 个时间序列和 538 万个数据点,来自 63 起源源自 Datadog 内部遥测数据的生产事件。我们评估了领先的专有和开源大语言模型 (LLM)、视觉语言模型 (VLM) 和时间序列模型 (TSFM),发现前沿 VLM 在现有基线上表现显著更佳;最佳模型 (GPT-5) 实现了 62.7% 的准确率和 51.9% 的 F1 分数。我们进一步展示了专用多模态方法的潜力。我们开发了一种新颖的 TSFM + VLM 混合原型,并通过针对少量合成和真实数据的后训练,使其在整体 F1 和准确率方面与前沿模型持平。最后,我们发现模型和人类领域专家表现出互补的优势。我们定义了一种模型-专家选择器的最佳 2 选手 oracle,实现 82.8% 的 F1 和 87.2% 的准确率,建立了未来 TSQA 模型的超人类前沿。该基准可在 https://huggingface.co/datasets/Datadog/ARFBench 上获取。

关键词

引用

@article{arxiv.2604.21199,
  title  = {ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response},
  author = {Stephan Xie and Ben Cohen and Mononito Goswami and Junhong Shen and Emaad Khwaja and Chenghao Liu and David Asker and Othmane Abou-Amal and Ameet Talwalkar},
  journal= {arXiv preprint arXiv:2604.21199},
  year   = {2026}
}

备注

Updated author affiliation