HEARTS:面向健康时间序列的 LLM 推理基准测试
机器学习
2026-03-17 v2 人工智能
摘要
大型语言模型(LLM)的兴起已将时间序列分析从狭义分析转向通用推理。然而,现有基准仅覆盖健康时间序列的少数模态和任务,无法反映真实生理建模中所涉及的多样化领域和广泛时序依赖性。为弥合这一差距,我们引入 HEARTS(Health Reasoning over Time Series),即用于评估 LLM 在通用健康时间序列上进行层次化推理能力的统一基准。HEARTS 集成了 16 个真实世界数据集,覆盖 12 个健康领域和 20 种信号模态,并定义了 110 项任务的全面分类体系,这些任务分为四个核心能力:感知、推断、生成与推理。我们在超过 2 万个测试样本上评估了 14 个最先进 LLM,结果令人感兴趣。首先,LLM 在 specialized models 上表现显著落后,且其表现仅与一般推理分数关系不大。此外,LLM 常依赖简单启发式方法,难以处理多步时序推理。最后,随着时序复杂度的增加,性能会下降,同一模型家族内部的失败模式相似,这表明仅靠规模扩大是不够的。通过使这些差距可衡量,HEARTS 提供了标准化的测试平台和活跃基准,为开发具备推理能力的下一代 LLM 代理(agent)奠定了基础,这些代理能够处理多样化的健康信号。
引用
@article{arxiv.2603.06638,
title = {HEARTS: Benchmarking LLM Reasoning on Health Time Series},
author = {Sirui Li and Shuhan Xiao and Mihir Joshi and Ahmed Metwally and Daniel McDuff and Wei Wang and Yuzhe Yang},
journal= {arXiv preprint arXiv:2603.06638},
year = {2026}
}