中文

大语言模型与推理模型时空推理基准测试:能力与挑战

人工智能 2026-01-13 v3 机器学习 信号处理

摘要

时空推理在信息物理系统中扮演着关键角色。尽管大语言模型和大推理模型取得了进步,但它们对复杂时空信号进行推理的能力仍未得到充分探索。本文提出了一个分层的时空推理基准测试STARK,用于系统地评估大语言模型在三个推理复杂度级别上的表现:状态估计(例如,预测场变量、在时空中定位和跟踪事件)、基于状态的时空推理(例如,推断时空关系),以及整合上下文和领域知识的世界知识感知推理(例如,意图预测、地标感知导航)。我们策划了26个具有不同传感器模态的独特时空任务,包含14,552个挑战,模型直接回答或通过Python代码解释器回答。评估了3个LRM和8个LLM,我们发现LLM在需要几何推理的任务中成功率有限,尤其是随着复杂性的增加。令人惊讶的是,LRM在各种难度级别的任务中表现出稳健的性能,通常能与基于第一性原理的传统方法竞争或超越它们。我们的结果表明,在需要世界知识的推理任务中,LLM和LRM之间的性能差距缩小,一些LLM甚至超越了LRM。然而,LRM o3模型在所有评估任务中继续保持领先性能,这一结果主要归因于推理模型更大的规模。STARK通过提供一个结构化框架来识别LLM和LRM在时空推理方面的局限性,从而激励智能CPS在模型架构和推理范式上的未来创新。

关键词

引用

@article{arxiv.2505.11618,
  title  = {Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges},
  author = {Pengrui Quan and Brian Wang and Kang Yang and Liying Han and Mani Srivastava},
  journal= {arXiv preprint arXiv:2505.11618},
  year   = {2026}
}