中文

AgentThink:面向自动驾驶的视觉语言模型工具增强链律推理统一框架

机器人学 2025-09-30 v4 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型 (VLM) 在自动驾驶领域显示出前景,但因幻觉、推理效率低且缺乏实际验证,导致其在感知和稳健的逐步推理方面表现不足。为此,我们提出一种前沎的统一框架——\textbf{AgentThink},将链律推理 (Chain-of-Thought, CoT) 与动态的、基于智能体的工具调用相结合,用于自动驾驶任务。AgentThink 的核心创新包括:\textbf{(i) 结构化数据生成},建立自动驾驶工具库,自动构建显式包含工具使用的结构化、自验证推理数据,以涵盖多种驾驶情景;\textbf{(ii) 两阶段训练管道},采用监督微调 (SFT) 结合群体相对策略优化 (GRPO),使 VLM 具备自主调用工具的能力;\textbf{(iii) 智能体式工具使用评估},引入新颖的多工具评估协议,严格评估模型的工具调用与利用。在 DriveLMM-o1 测试基准上的实验表明,AgentThink 将整体推理得分提升了 **53.91%**,答案准确率提升 **33.54%**,显著改善推理质量和一致性。此外,消融实验和在多种基准上的鲁棒零样本/少样本泛化实验进一步彰显了其强大能力。这些发现凸显了开发可信且工具感知型自动驾驶模型的前景路径。代码已公开于 https://github.com/curryqka/AgentThink。

关键词

引用

@article{arxiv.2505.15298,
  title  = {AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving},
  author = {Kangan Qian and Sicong Jiang and Yang Zhong and Ziang Luo and Zilin Huang and Tianze Zhu and Kun Jiang and Mengmeng Yang and Zheng Fu and Jinyu Miao and Yining Shi and He Zhe Lim and Li Liu and Tianbao Zhou and Huang Yu and Yifei Hu and Guang Li and Guang Chen and Hao Ye and Lijun Sun and Diange Yang},
  journal= {arXiv preprint arXiv:2505.15298},
  year   = {2025}
}

备注

19 pages, 8 figures