基于视觉语言-动作模型的场景响应式人类在环运动规划
计算机视觉与模式识别
2026-02-05 v1 人工智能
机器学习
机器人学
摘要
指令导向驾驶即 Passenger 的语言指导轨迹规划,需要车辆在运动前理解意图。然而,大多数先前的指令跟随规划器依赖仿真或固定命令词汇,限制了现实场景的泛化。doScenes 是首个将自由形式指令(含指代性)与 nuScenes 真实运动 ground-truth 关联的数据集, enables 指令条件化规划。本 work 采用 OpenEMMA,一个开源 MLLM-based end-to-end 驾驶框架,输入前视摄像头视图和 ego-state,输出 10 步速度-曲率轨迹,适用于本场景,present 一套在 doScenes 上可复现的指令条件化基线,并探讨人类指令提示对预测驾驶行为的影响。我们将 doScenes 指令作为乘客式提示嵌入 OpenEMMA 的视觉语言接口,实现语言条件化的轨迹生成。在 849 个标注场景中使用 ADE 评估,我们观察到指令条件化显著提升鲁棒性,通过防止极端 baseline 失败,使 mean ADE 降低98.7%。当排除这些异常值后,指令仍影响轨迹对齐,优质提示可使 ADE 最多提升5.1%。我们依据此分析讨论何为对 OpenEMMA 框架“好”指令。我们发布评估提示和脚本,以建立可复现的指令感知规划基线。GitHub: https://github.com/Mi3-Lab/doScenes-VLM-Planning
引用
@article{arxiv.2602.04184,
title = {Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models},
author = {Angel Martinez-Sanchez and Parthib Roy and Ross Greer},
journal= {arXiv preprint arXiv:2602.04184},
year = {2026}
}