面向大视觉语言模型的自监督视觉编码器的隐形后门攻击
计算机视觉与模式识别
2025-03-27 v3
摘要
自监督学习(SSL)视觉编码器能够学习高质量的图像表征,因此成为开发大型视觉语言模型(LVLMs)视觉模态的关键组件。由于训练此类编码器的高昂成本,这些预训练编码器被广泛共享并部署到许多LVLMs中,而这些模型可能涉及安全关键或具有社会意义。在这一实际场景下,我们揭示了一种新的后门威胁:仅通过破坏视觉编码器即可诱导这些LVLMs产生显著的视觉幻觉。由于这些编码器的共享与重用,许多下游LVLMs可能继承这些编码器的后门行为,导致后门问题的广泛传播。在本文中,我们提出了BadVision,一种利用新颖触发器优化和后门学习技术来利用SSL视觉编码器中漏洞的方法。我们在两种类型的SSL编码器和LVLMs上进行了八个基准测试的评估。我们表明,BadVision能够以超过99%的攻击成功率,引导LVLMs实现攻击者选择的幻觉,同时保持隐蔽性,造成77.6%的相对视觉理解错误。现有的SOTA后门检测方法无法有效检测我们的攻击。
引用
@article{arxiv.2502.18290,
title = {Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models},
author = {Zhaoyi Liu and Huan Zhang},
journal= {arXiv preprint arXiv:2502.18290},
year = {2025}
}