两鸟同进:通过推理时特征投影实现LVLMs安全性与实用性的和谐
计算机视觉与模式识别
2026-03-17 v1 人工智能
摘要
现有的大型视觉语言模型(LVLMs)防作弊框架往往存在安全性与实用性之间的权衡,即加强安全性会不利于在一般视觉基础推理任务上的性能。本文探讨了安全性与实用性是否存在固有的对立性。我们聚焦于一种在数据集中一致观察到的模态诱导偏置方向,该偏置源于大型语言模型主干网络与视觉编码器之间的次优耦合。我们进一步表明,该方向会损害两项任务的性能。基于此洞察,我们提出了Two Birds, One Projection,一种高效的推理时防作弊方法,通过将跨模态特征投影到所识别偏置方向的零空间,以去除相应分量。该方法仅需一次前向传播,即可有效打破传统权衡,在多样化基准测试中同时提升安全性和实用性。
引用
@article{arxiv.2603.14825,
title = {Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection},
author = {Yewon Han and Yumin Seol and EunGyung Kong and Minsoo Jo and Taesup Kim},
journal= {arXiv preprint arXiv:2603.14825},
year = {2026}
}