从 VLM 提取风险语义蒸馏以增强端到端自动驾驶
计算机视觉与模式识别
2025-11-19 v1 机器人学
摘要
自动驾驶(AD)系统在复杂驾驶场景中展现出卓越性能。然而,泛化能力仍是当前系统的关键局限,这指的是其处理未见场景或不熟悉传感器配置的能力。相关工作探索了利用视觉语言模型(VLM)来解决零样本或少样本任务。尽管前景光明,但这些方法带来了一个新挑战:出现混合 AD 系统,其中使用两个不同系统来规划轨迹,可能导致不一致。另一些研究方向探索了视觉语言-动作(VLA)框架,直接从 VLM 生成控制动作。然而,这些端到端解决方案计算需求巨大。为克服这些挑战,我们引入风险语义蒸馏(RSD)框架,利用 VLM 增强端到端(E2E)AD 主干网络的训练。通过为关键对象提供风险注意力,RSD 解决了泛化问题。具体而言,我们引入 RiskHead 模块,将来自视觉语言模型的因果风险估计蒸馏到鸟瞰图(BEV)特征中,生成可解释的风险注意力图。这一方法使 BEV 特征能够学习更丰富、更细致的风险注意力表示,直接提升模型处理空间边界和风险对象的能力。通过聚焦风险注意力,RSD 更符合人类驾驶行为,这对于在复杂动态环境中导航至关重要。我们在 Bench2Drive 基准上进行实验,证明了 RSD 在处理复杂不可预测驾驶条件方面的有效性。由于 RSD 所能实现的增强 BEV 表示,观察到在感知和规划能力方面均取得显著提升。
引用
@article{arxiv.2511.14499,
title = {Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM},
author = {Jack Qin and Zhitao Wang and Yinan Zheng and Keyu Chen and Yang Zhou and Yuanxin Zhong and Siyuan Cheng},
journal= {arXiv preprint arXiv:2511.14499},
year = {2025}
}