中文

BEDTime:用于自动描述时间序列的统一基准

计算与语言 2026-04-13 v3 机器学习

摘要

近期研究提出了复杂的多模态模型,既处理时间序列又处理语言,最终声称在时间序列推理和跨模态问答等复杂任务上取得高性能。然而,这些模型跳过了应有的数据评估。我们提出了一个简单问题:"最近的模型在多大程度上能描述时间序列的结构属性?"为此,我们认为成功的模型应能够"识别"、"区分"和"生成"单变量时间序列的描述。我们随后构建了\textbf{\benchmark},以评估这些新任务,包含\textbf{五个数据集},跨\textbf{三个模态}重构。评估\textbf{17个最新模型}时,我们发现:(1) surprisingly, dedicated time series-language models fall short, despite being designed for similar tasks, (2) vision language models are quite capable, (3) language only methods perform worst, despite many lauding their potential, and (4) all approaches are clearly fragile to a range of real world robustness tests, indicating directions for future work. Together, our findings critique prior works' claims and provide avenues for advancing multi-modal time series modeling.

关键词

引用

@article{arxiv.2509.05215,
  title  = {BEDTime: A Unified Benchmark for Automatically Describing Time Series},
  author = {Medhasweta Sen and Zachary Gottesman and Jiaxing Qiu and C. Bayan Bruss and Nam Nguyen and Tom Hartvigsen},
  journal= {arXiv preprint arXiv:2509.05215},
  year   = {2026}
}