中文

SEAL:基于视觉语言模型的安全端到端协同自动驾驶与自适应长尾建模

机器人学 2025-07-08 v2 人工智能 计算机视觉与模式识别

摘要

自动驾驶技术在罕见、多样且视觉退化的天气场景下运行时面临重大的安全挑战。在协同环境中,这些挑战变得更加严峻,因为车辆和基础设施需要在复杂环境中共同进行感知和推理。为了解决这些问题,我们提出了 SEAL,这是一个基于视觉语言模型并具有自适应多模态学习的框架,旨在实现长尾场景下稳健的协同自动驾驶。SEAL 引入了三项核心创新: 提示驱动的长尾场景生成与评估流水线,利用基础模型在车端和基础设施端视图上合成真实的雪和雾等长尾条件,从而高效地丰富训练多样性; 门控多场景自适应注意力模块,利用场景先验调制视觉流,以重新校准模糊或损坏的特征; 多任务场景感知对比学习目标,改善多模态对齐并促进跨场景特征的可分离性。大量实验表明,SEAL 在复杂且具挑战性的驾驶条件下的推理、安全性和规划准确性方面显著优于现有基线,提升了自动驾驶的安全性、稳健性和可扩展性。

关键词

引用

@article{arxiv.2506.21041,
  title  = {SEAL: Vision-Language Model-Based Safe End-to-End Cooperative Autonomous Driving with Adaptive Long-Tail Modeling},
  author = {Junwei You and Pei Li and Zhuoyu Jiang and Zilin Huang and Rui Gan and Haotian Shi and Bin Ran},
  journal= {arXiv preprint arXiv:2506.21041},
  year   = {2025}
}