通过逆运动学实现驾驶VLA的视觉锚定
计算机视觉与模式识别
2026-05-21 v1 人工智能
机器人学
摘要
现有的驾驶VLA(Vision-Language-Action)模型在预测轨迹时几乎忽略视觉标记,导致模型在ego状态和文本指令上走捷径。我们通过逆运动学视角阐明,轨迹恢复需要当前与未来视觉状态作为边界条件,而现有VLA仅提供前者。为此,我们以逆运动学求解器的形式重新设计驾驶VLA:首先,引入next visual state预测目标,要求LLM预测未来视觉场景,从而提供密集视觉监督并抑制捷径路径;其次,设计独立的逆运动学网络(基于交叉注意力的条件扩散模型),仅以当前与未来视觉状态为输入,以减少对ego状态和文本捷径的依赖。在轨迹解码阶段,实施此简单方案后,0.5B规模模型便恢复了视觉锚定能力,性能接近7B至8B规模VLA,均优势约一个数量级,分别在封闭环NAVSIM-v2和nuScenes基准上取得优异成绩。广泛分析表明,改进源于模型恢复利用视觉特征的能力,尤其在动态驾驶场景(如转向)中效果最为显著。
引用
@article{arxiv.2605.21061,
title = {Grounding Driving VLA via Inverse Kinematics},
author = {Junsung Park and Hyunjung Shim},
journal= {arXiv preprint arXiv:2605.21061},
year = {2026}
}