大型语言模型(LLM)是否理解时间顺序?
摘要
大型语言模型(LLM)在金融和经济学中日益受到使用,其中基于提示的尝试隐式假设模型理解时间顺序。我们通过一系列逐渐增加复杂性的有序任务来测试这一根本性问题,这些任务涉及模型已知的事实。我们的任务包括(1)时间顺序排列,(2)条件排序(过滤后排序),和(3)时代错置检测。我们评估了 GPT-4.1、Claude-3.7 Sonnet,带和不带扩展思维(Extended Thinking, ET),以及 GPT-5 在多个推理-effort 设置下的表现。在所有模型中,随着序列长度增加,精确匹配率急剧下降,但排名相关系数保持较高,因为LLM主要保持局部顺序,但难以维持单一的全局一致时间线。在条件排序中,大多数失败源于过滤步骤而非排序步骤,但 GPT-5 和带扩展思维的 Claude-3.7 Sonnet 在正常模型中显著优于。最后发现,时代错置检测是LLM最容易的任务,但性能随时间线和实体重叠度增加而下降。总体而言,我们的主要贡献是表明分配显式推理预算有助于时间顺序排序,GPT-5 在中等/高推理 effort 下实现所有长度的完美排序和完美条件排序(包括自过滤和给定子集),而低/最小 effort 则随列表长度下降,类似早期模型。我们的发现阐明了当前LLM在时间顺序任务中的局限性,为任务复杂性提供了见解,并展示了推理在何时有帮助的场景。这些模式对于LLM在金融中的实时应用至关重要。我们发布所有代码和评估模板以支持完全可重复性。
引用
@article{arxiv.2511.14214,
title = {Do Large Language Models (LLMs) Understand Chronology?},
author = {Pattaraphon Kenny Wongchamcharoen and Paul Glasserman},
journal= {arXiv preprint arXiv:2511.14214},
year = {2025}
}
备注
Version 2: corrected footnote and added code repository link. Extended version of our work presented at the AAAI-26 AI4TS Workshop (poster) and AAAI-26 Student Abstract Program (oral)