LLaViDA:面向显式推理与增强轨迹规划的大语言视觉驾驶助手
机器人学
2025-12-23 v1 人工智能
摘要
轨迹规划是自动驾驶中既基础又具挑战性的关键组件。端到端规划器常因恶劣天气、不可预测的人类行为或复杂道路布局而失效,主要因为其在训练数据之外缺乏强大的泛化或few-shot能力。我们提出LLaViDA(Large Language Vision Driving Assistant),一种大语言视觉驾驶助手,利用视觉语言模型(Vision-Language Model, VLM)进行目标运动预测、语义定位和链条推理,以实现自动驾驶中的轨迹规划。采用两阶段训练流程——监督微调 followed by Trajectory Preference Optimization(TPO)——通过注入回归式监督,增强场景理解和轨迹规划能力,构建强大的“用于自动驾驶的VLM轨迹规划器”。在NuScenes基准测试中,LLaViDA在开放式轨迹规划任务中超越了最先进的端到端方法和其他近期基于VLM/LLM的基线,实现平均L2轨迹误差为0.31米,碰撞率为0.10%(在NuScenes测试集上)。本文的代码已在GitHub上提供。
引用
@article{arxiv.2512.18211,
title = {LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning},
author = {Yudong Liu and Spencer Hallyburton and Jiwoo Kim and Yueqian Lin and Yiming Li and Qinsi Wang and Hui Ye and Jingwei Sun and Miroslav Pajic and Yiran Chen and Hai Li},
journal= {arXiv preprint arXiv:2512.18211},
year = {2025}
}