VLA-R:面向开放世界的端到端自动驾驶——视觉-语言-动作检索
计算机视觉与模式识别
2025-11-18 v1
摘要
在开放世界环境中以端到端方式探索是一项有前景但富有挑战性的任务,因需具备强大的泛化能力。特别是对于非结构化户外环境中的端到端自动驾驶,常常会遭遇训练期间未曾遇到的情形。本文提出视觉-语言-动作检索(VLA-R)框架,构建面向开放世界的端到端自动驾驶(OW-E2EAD)系统,将开放世界感知与新颖的视觉-动作检索范式相结合。我们利用冻结的视觉-语言模型实现开放世界检测和分割,获取多尺度、提示导向且可解释的感知特征,无需特定领域调优。Q-Former 瓶颈将细粒度视觉表征与语言对齐的视觉特征相聚,桥接感知与动作领域。为学习可迁移的驾驶行为,我们引入视觉-动作对比学习方案,对齐视觉-语言与动作嵌入,实现有效的开放世界推理与动作检索。我们的实验在真实世界机器人平台上表明,在非结构化且未见环境中,本方法展现出强大的泛化与探索性能,即便数据有限亦可实现。附录材料中提供了演示视频。
引用
@article{arxiv.2511.12405,
title = {VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving},
author = {Hyunki Seong and Seongwoo Moon and Hojin Ahn and Jehun Kang and David Hyunchul Shim},
journal= {arXiv preprint arXiv:2511.12405},
year = {2025}
}
备注
9 pages, 9 figures