视觉自我实现对齐:通过威胁相关图像塑造以安全为导向的角色人格
计算机视觉与模式识别
2026-04-16 v2 人工智能
摘要
多模态大语言模型(MLLMs)面临安全错位问题,视觉输入可导致有害输出。为解决此问题,现有方法需要明确的安全标签或对比数据;然而,威胁相关概念是具体且可视化的,而安全概念如有帮助性则是抽象的,缺乏视觉指涉对象。灵感来自于新兴错位背后的自我实现机制,我们提出视觉自我实现对齐(VSFA)。VSFA在围绕威胁相关图像构建的中性VQA任务上对视觉语言模型(VLMs)进行微调,无需任何安全标签。通过反复接触威胁相关的视觉内容,模型内化了警觉性和谨慎的隐式语义,从而塑造出以安全为导向的角色人格。跨多个VLMs和安全基准的实验表明,VSFA降低了攻击成功率,提高了响应质量,同时减轻了过度拒绝,同时保持了通用能力。我们的工作将自我实现机制从文本扩展到视觉模态,提供一种无标签的VLMs对齐方法。
引用
@article{arxiv.2603.08486,
title = {Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images},
author = {Qishun Yang and Shu Yang and Lijie Hu and Di Wang},
journal= {arXiv preprint arXiv:2603.08486},
year = {2026}
}