TPS-Drive:基于 VLM 的自主驾驶任务引导表征净化
机器人学
2026-05-27 v1
摘要
视觉语言模型 (VLM) 为自主驾驶规划提供了有前景的基础,但在语义推理与精确 3D 空间预测之间架起关键挑战仍存。现有表征策略 generally 遵循两条路径:文本对齐方法将连续空间状态展平为符号,这会损害几何结构并诱导出“空间幻觉”;密集视觉方法保留空间拓扑但使标准标记器负担过重,导致“表征干扰”。为解决这些限制,我们引入 TPS-Drive,一种以任务引导表征净化为核心的新框架,使 VLM 能够在净化空间中进行思考。其核心是利用任务引导的向量量化机制,由冻结的 3D 检测头监督,显式地将有限的词表容量从普遍的静态背景重新分配到关键动态主体,从而有效隔离空间冗余。利用这个净化后的空间词汇,TPS-Drive 采用解耦的推理管道,依次执行场景理解、未来预测和动作生成。该框架通过渐进式三阶段训练优化,最终实现奖励驱动的精炼,超越纯模仿学习。大量实验验证了我们的方案:TPS-Drive 实现了准确的主体空间状态预测,并在开放式 nuScenes 评估中降低了碰撞率,同时在严格的闭环 NAVSIMv1 和 NAVSIMv2 基准上创下新的安全纪录。
引用
@article{arxiv.2605.27038,
title = {TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving},
author = {Jiaxiang Li and Yumao Liu and Ke Ma},
journal= {arXiv preprint arXiv:2605.27038},
year = {2026}
}