Reasoning-VLA:面向自动驾驶的高效通用视觉-语言-动作推理模型
计算机视觉与模式识别
2025-11-26 v1 机器人学
摘要
视觉-语言-动作 (VLA) 模型最近在自动驾驶领域展现出强大的决策能力。然而,现有 VLA 方法往往难以实现高效推理并泛化到新型自动驾驶配置和驾驶场景。本文提出 Reasoning-VLA,一个通用且高效的动作生成 VLA 框架。该模型采用一组可学习的动作查询,通过从训练语料库中基于真实轨迻的高斯采样进行初始化。这些可学习查询与增强推理的视觉-语言特征交互,以并行方式生成连续动作轨迹。为促进鲁棒泛化,我们将八个公开的自动驾驶数据集整合为标准化的、基于链式思考推理的、易于使用的训练数据格式。基于监督学习和强化学习微调,广泛的实验评估表明,Reasoning-VLA 在多个基准上实现了最前沿的性能,具备卓越的泛化能力和优异的推理速度。
引用
@article{arxiv.2511.19912,
title = {Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving},
author = {Dapeng Zhang and Zhenlong Yuan and Zhangquan Chen and Chih-Ting Liao and Yinda Chen and Fei Shen and Qingguo Zhou and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2511.19912},
year = {2025}
}