中文

面向视觉感知攻击下固有鲁棒的视觉语言模型

计算机视觉与模式识别 2026-02-10 v3 机器学习

摘要

自动驾驶汽车依赖深度神经网络(DNN)进行交通标志识别、车道居中和车辆检测,但这些模型容易受到导致误分类并威胁安全的攻击。现有的防御方法(如对抗训练)通常无法泛化,且会降低干净数据的准确率。我们引入了车辆视觉语言模型(V2LM),这是一种针对自动驾驶车辆感知进行微调的视觉语言模型,并证明它们在没有对抗训练的情况下对未见攻击具有固有的更强的鲁棒性,保持了比传统DNN显著更高的对抗准确率。我们研究了两种部署方式:Solo(任务特定的V2LM)和Tandem(一个V2LM用于所有三个任务)。在攻击下,DNN下降33-74%,而V2LM平均下降不到8%。Tandem在保持与Solo相当鲁棒性的同时更加节省内存。我们还探索将V2LM与现有感知栈并行集成以增强鲁棒性。我们的结果表明V2LM是实现安全、鲁棒的自动驾驶感知的有前景的路径。

关键词

引用

@article{arxiv.2506.11472,
  title  = {Toward Inherently Robust VLMs Against Visual Perception Attacks},
  author = {Pedram MohajerAnsari and Amir Salarpour and Michael Kühr and Siyu Huang and Mohammad Hamad and Sebastian Steinhorst and Habeeb Olufowobi and Bing Li and Mert D. Pesé},
  journal= {arXiv preprint arXiv:2506.11472},
  year   = {2026}
}

备注

Accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV 2026)