中文

SPAN:衡量与提升大语言模型跨日历时序推理能力的基准

人工智能 2026-01-12 v2

摘要

我们提出 SPAN,一个跨日历时序推理基准测试,要求大语言模型 (LLM) 执行日内日历时序推理和日历间时序转换。SPAN 涵盖十个跨日历时序推理方向、两种推理类型和两种问答格式,涉及六个日历系统。为实现时变且无数据污染的评估,我们提出基于模板的动态实例生成协议,支持用户指定的儒略历日期进行评估。我们在1960至2060年跨越100年的多个日期上,对开源和闭源的最新 (SOTA) LLM 进行了大规模实验。我们的评估显示,这些 LLM 平均准确率仅为34.5%,且无一模型超过80%,表明该任务仍具挑战性。通过对推理类型、问答格式和时序推理方向的深入分析,我们识别出 LLM 面临的两个关键障碍:未来日期退化和日历不对称偏差。为提升 LLM 的跨日历时序推理能力,我们进一步开发了一个基于 LLM 的 Time Agent,利用工具增强的代码生成。实证结果表明,Time Agent 的平均准确率达95.31%,超越多个竞争性基线,凸显了工具增强代码生成在推进跨日历时序推理方面的潜力。我们希望本工作能激发进一步的研究,致力于构建更具时序和文化适应性的 LLM。

关键词

引用

@article{arxiv.2511.09993,
  title  = {SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models},
  author = {Zhongjian Miao and Hao Fu and Chen Wei},
  journal= {arXiv preprint arXiv:2511.09993},
  year   = {2026}
}

备注

Accepted at the AAAI 2026 conference. This version includes the supplementary appendix