面向端到端驾驶的碰撞感知视觉-语言学习:结合多模态违规数据集
计算机视觉与模式识别
2026-03-30 v1 人工智能
机器学习
摘要
高违规率仍然是端到端(E2E)自动驾驶的主要瓶颈,正如 CARLA 排行榜上的低驾驶分数所证明的那样。尽管与碰撞相关的违规是闭环评估中的主要失败模式,但碰撞感知的表示学习受到的关注有限。为填补这一空白,我们首先开发了一种视频-语言增强异常检测器(VLAAD),利用多重实例学习(MIL)公式来获得稳定、时间局部化的碰撞信号,用于主动预测。为了将这些能力转移到闭环仿真中,我们必须克服现有仿真数据集的局限性,这些数据集缺乏多模态性且经常局限于简单的交叉场景。因此,我们引入了 CARLA-Collide,一个大规模多模态数据集,捕捉了高度多样化道路网络中真实的碰撞事件。在该多样化仿真数据上训练后,VLAAD 作为碰撞感知即插即用模块,可以无缝集成到现有的 E2E 驾驶模型中。通过将我们的模块集成到预训练的 TransFuser++ 智能体中,我们展示了驾驶分数 14.12% 的相对提升,且微调量极少。除了闭环评估,我们还在开放环路设置中使用真实驾驶数据进一步评估了 VLAAD 的泛化能力。为支持此分析,我们引入了 Real-Collide,一个由多样化行车记录仪视频组成的多模态数据集,配有用于碰撞检测和预测的语义丰富标注。在该基准测试上,尽管仅包含 0.6B 参数,VLAAD 仍优于一个多数十亿参数视觉-语言模型,在 AUC 上实现了 23.3% 的提升。
引用
@article{arxiv.2603.25946,
title = {Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets},
author = {Alex Koran and Dimitrios Sinodinos and Hadi Hojjati and Takuya Nanri and Fangge Chen and Narges Armanfard},
journal= {arXiv preprint arXiv:2603.25946},
year = {2026}
}
备注
33 pages, 11 figures