中文

TS-Haystack:面向长上下文时间序列推理的多任务检索基准

机器学习 2026-05-14 v5

摘要

时间序列语言模型(TSLMs)承诺能够处理真实的时序数据,但其在长时间序列检索和推理方面的能力尚未得到充分测试。我们引入 TS-Haystack,一个包含十个事件 grounding 的问答任务的多域检索基准,上下文长度从 100 秒到 24 小时,涵盖直接检索、时序推理、多步骤推理和情境异常检测。现有的 TSLMs 在长上下文表现严重下降:随着上下文长度增加,准确率下降;直接标记化模型在高采样率信号上超过 100 秒后会耗尽内存;当增加时间序列长度时,基于时间区间的任务会向接近零的准确率崩溃,这与文本和多模态长上下文检索的现有文献一致。使用专用时间序列分类器工具的智能体检索框架在 9 个中的 10 个任务上匹配或超越了最先进的 TSLMs,凸显了智能体检索作为长上下文 TSLMs 的有前景的ethods。

关键词

引用

@article{arxiv.2602.14200,
  title  = {TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning},
  author = {Nicolas Zumarraga and Thomas Kaar and Ning Wang and William Tennien and Alpay Hasanli and Max Rosenblattl and Fan Wu and Kevin Riehl and Maxwell A. Xu and Markus Kreft and Kevin O'Sullivan and Elgar Fleisch and Paul Schmiedmayer and Robert Jakob and Patrick Langer},
  journal= {arXiv preprint arXiv:2602.14200},
  year   = {2026}
}

备注

Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack