DriveAgent-R1:面向主动感知与混合思维的基于VLM的自动驾驶
计算机视觉与模式识别
2026-04-21 v3
摘要
视觉语言模型(VLM)的出现显著推动了端到端自动驾驶技术的发展,展现出处理高层行为规划任务的强大推理能力。然而,现有方法往往受限于被动感知范式,仅依赖文本-based 推理。这种被动性限制了模型在面对不确定性时主动寻求关键视觉证据的能力。为此,我们引入DriveAgent-R1,首个具备主动感知能力的自动驾驶代理。在复杂场景中,DriveAgent-R1主动调用工具进行视觉推理,以视觉证据为依托,从而增强了可解释性和可靠性。此外,我们提出一种混合思维框架,模仿人类司机的认知模式,使代理能够根据场景复杂度自适应地在高效的文本-only 推理与稳健的工具增强视觉推理之间切换。这种能力通过三个阶段的渐进式训练策略培养,包括核心的级联强化学习(Cascaded RL)阶段。在Drive-Internal数据集丰富的长尾场景以及公开的nuScenes数据集上进行大量实验表明,仅凭3B参数,DriveAgent-R1即可实现与GPT-5等顶级闭源模型系统及人类驾驶水平相当的竞争性性能,同时保持部署友好性,为构建更智能的自动驾驶系统提供了可行的路径。
引用
@article{arxiv.2507.20879,
title = {DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking},
author = {Weicheng Zheng and Xiaofei Mao and Nanfei Ye and Pengxiang Li and Kun Zhan and Xianpeng Lang and Hang Zhao},
journal= {arXiv preprint arXiv:2507.20879},
year = {2026}
}
备注
Accepted to ICLR 2026