中文

从提示到随时间推移的路面:智能体场景到规划推理中的时序定位

人工智能 2026-05-20 v1 计算与语言 计算机视觉与模式识别 机器人学

摘要

近期利用大语言模型(LLM)和大规模多模态模型(LMM)的集成来支持自动驾驶汽车(AV)的高层场景解释与规划的尝试,仍然将时间视为次要属性。这种时序定位的缺失导致了对连续动作推理的不一致性,损害了安全性和可解释性。本工作探讨了智能体间通信中的时序条件化是否能在不降低语义或逻辑一致性的情况下保持或增强连贯性。为此,我们引入了三种时序集成度逐步增加的规划器架构,并在 BDD-X 数据集的精选子集上使用语义、句法和逻辑指标对它们进行了评估。结果表明,虽然时序条件化重塑了推理风格,但在标准的基于 NLP 的正确性指标上并未产生统计上显著的改进。然而,定性分析揭示了预测性危险推理、稳定的纠正行为以及 Sentinel 中的策略性分歧。这些发现阐明了基于提示的时序定位的局限性,并为时序场景到规划推理建立了首个经验基准。

关键词

引用

@article{arxiv.2605.19824,
  title  = {From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning},
  author = {Ahmed Y. Gado and Omar Y. Goba and Alaa Hassanein and Catherine M. Elias and Ahmed Hussein},
  journal= {arXiv preprint arXiv:2605.19824},
  year   = {2026}
}