FLARE:从视觉-语言模型中学习面向未来的潜在表征用于自动驾驶
计算机视觉与模式识别
2026-03-10 v2
摘要
尽管视觉-语言模型(VLMs)为端到端自动驾驶提供了丰富的世界知识,但当前方法严重依赖劳动密集型的语言标注(例如,视觉问答 VQA)来连接感知与控制。这种范式存在离散语言标记与连续驾驶轨迹之间的根本性不匹配,通常导致次优的控制策略和对预训练知识的低效利用。为解决这些挑战,我们提出 FLARE(面向未来的潜在表征),这是一个无需语言监督即可激活预训练 VLM 的视觉-语义能力的新颖框架。我们并非与文本对齐,而是引入了一种自监督的未来特征预测目标。该机制迫使模型直接在潜在空间中预测场景动态和自车运动,从而能够从大规模无标注轨迹数据中学习鲁棒的驾驶表征。此外,我们将分组相对策略优化(GRPO)集成到规划过程中,以提升决策质量。在 NAVSIM 基准上的大量实验表明,FLARE 达到了最先进的性能,验证了通过预测性自监督而非显式语言生成来利用 VLM 知识的有效性。
引用
@article{arxiv.2601.05611,
title = {FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving},
author = {Chengen Xie and Chonghao Sima and Tianyu Li and Bin Sun and Junjie Wu and Zhihui Hao and Hongyang Li},
journal= {arXiv preprint arXiv:2601.05611},
year = {2026}
}