DriveRX:面向跨任务自动驾驶的视觉-语言推理模型
计算机视觉与模式识别
2026-01-14 v2
摘要
有效的自动驾驶依赖于对感知、预测、规划和行为进行鲁棒的推理。然而,传统的端到端模型由于缺乏结构化推理,难以在复杂场景中泛化。尽管最近的视觉-语言模型(VLMs)已被应用于驾驶任务,但它们通常依赖于孤立的模块和静态监督,限制了其支持多阶段决策的能力。我们提出了 AutoDriveRL,一个将自动驾驶形式化为涵盖四个核心任务的结构化推理过程的统一训练框架。每个任务被独立建模为一个视觉-语言问答问题,并使用特定任务的奖励模型进行优化,从而在不同推理阶段提供细粒度的强化信号。在此框架内,我们训练了 DriveRX,一个专为多阶段决策设计的跨任务推理 VLM。DriveRX 在公开基准测试上取得了强劲的性能,在行为推理方面超越了 GPT-4o,并在复杂或受损的驾驶条件下表现出鲁棒性。DriveRX 作为一个高级语义推理主干,生成结构化的分阶段推理链,以增强决策一致性。这些输出也为标注和下游规划/控制模型提供了高质量的监督信号。我们发布了 AutoDriveRL 框架和 DriveRX 以支持未来的研究。
引用
@article{arxiv.2505.20665,
title = {DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving},
author = {Muxi Diao and Lele Yang and Hongbo Yin and Zhexu Wang and Yejie Wang and Daxin Tian and Kongming Liang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2505.20665},
year = {2026}
}