TIME:面向真实场景中 LLM 时序推理的多层次基准
人工智能
2025-10-09 v4 计算与语言
摘要
时序推理是大型语言模型 (LLM) 理解现实世界的关键。然而,现有研究忽视了时序推理的真实世界挑战:(1) 大量时序信息,(2) 快速变化的事件动态,(3) 社交互动中复杂的时序依赖关系。为弥合这一差距,我们提出一种多层次基准 TIME,旨在真实场景下的时序推理。TIME 包含 38,522 对 QA 配对,覆盖 3 个层次和 11 个细粒度子任务。该基准包含 3 个子数据集,反映不同的真实世界挑战:TIME-Wiki、TIME-News 和 TIME-Dial。我们在各种推理模型和非推理模型上进行大量实验。我们对时序推理在不同真实世界场景和任务中的表现进行深入分析,并总结了测试时规模对时序推理能力的影响。此外,我们发布了 TIME-Lite,一个人工标注的子集,以促进未来研究和标准化评估。代码可在 https://github.com/sylvain-wei/TIME 查看,数据集可在 https://huggingface.co/datasets/SylvainWei/TIME 获取,项目页面链接为 https://sylvain-wei.github.io/TIME/。
引用
@article{arxiv.2505.12891,
title = {TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios},
author = {Shaohang Wei and Wei Li and Feifan Song and Wen Luo and Tianyi Zhuang and Haochen Tan and Zhijiang Guo and Houfeng Wang},
journal= {arXiv preprint arXiv:2505.12891},
year = {2025}
}
备注
Accepted by NeurIPS 2025 (Spotlight)