中文

两鸟同进:通过推理时特征投影实现LVLMs安全性与实用性的和谐

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

现有的大型视觉语言模型(LVLMs)防作弊框架往往存在安全性与实用性之间的权衡,即加强安全性会不利于在一般视觉基础推理任务上的性能。本文探讨了安全性与实用性是否存在固有的对立性。我们聚焦于一种在数据集中一致观察到的模态诱导偏置方向,该偏置源于大型语言模型主干网络与视觉编码器之间的次优耦合。我们进一步表明,该方向会损害两项任务的性能。基于此洞察,我们提出了Two Birds, One Projection,一种高效的推理时防作弊方法,通过将跨模态特征投影到所识别偏置方向的零空间,以去除相应分量。该方法仅需一次前向传播,即可有效打破传统权衡,在多样化基准测试中同时提升安全性和实用性。

关键词

引用

@article{arxiv.2603.14825,
  title  = {Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection},
  author = {Yewon Han and Yumin Seol and EunGyung Kong and Minsoo Jo and Taesup Kim},
  journal= {arXiv preprint arXiv:2603.14825},
  year   = {2026}
}