视觉语言适应如何影响视觉语言模型的安全性?
计算与语言
2024-11-18 v2 计算机视觉与模式识别
摘要
视觉语言适应(VL适应)将大语言模型(LLMs)转化为大型视觉语言模型(LVLMs),以适应多模态任务,但这一过程常常会削弱原始LLMs中内嵌的安全能力。尽管因安全措施被削弱而可能引发潜在风险,但关于VL适应对安全性影响的深入分析仍属under-explored。本研究考察了VL适应如何影响安全性,并评估了安全微调方法的影响。我们的分析表明,即使训练数据本身安全,VL适应过程中仍会发生安全性能下降。虽然基于安全数据集的监督式微调或基于人类反馈的强化学习等安全调优技术能缓解部分风险,但仍会导致安全性能下降并因过度拒绝而降低帮助fulness。进一步的内部模型权重分析表明,VL适应可能影响某些与安全相关的层,从而降低整体安全水平。此外,我们的发现表明,VL适应与安全调优的目标是相互冲突的,这常常导致二者同时应用时效果不佳。为此,我们建议采用权重合并方法作为最优解决方案,有效降低安全性能下降的风险,同时保持帮助fulness。这一洞察有助于指导开发更可靠、更安全的LVLMs,以适应实际应用场景。
引用
@article{arxiv.2410.07571,
title = {How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?},
author = {Seongyun Lee and Geewook Kim and Jiyeon Kim and Hyunji Lee and Hoyeon Chang and Sue Hyun Park and Minjoon Seo},
journal= {arXiv preprint arXiv:2410.07571},
year = {2024}
}
备注
Work in Progress