以图像重新构思安全对齐
人工智能
2025-11-04 v1 密码学与安全
摘要
大型语言模型 (LLM) 在多样化应用中表现出色,但面临双重挑战:在越狱攻击下生成有害内容,以及由于刚性安全机制导致对善意查询的过度拒绝。这些问题又因需要适应不同的价值体系并精确对齐给定的安全偏好而加剧。此外,传统方法如 SFT 和 RLHF 由于成本高昂的参数调谐要求以及无法在单个模型中支持多个价值体系而缺乏这种能力。这些问题在多模态大型语言模型 (MLLM) 中尤为突出,尤其在跨模态任务中出现更高的过度拒绝,以及因扩大的攻击面而产生的新安全风险。我们提出了 Magic Image,一种基于优化的视觉提示框架,通过优化有害/善意样本中的图像提示来增强安全性并减少过度拒绝。我们的方法无需参数更新即可使单个模型适应不同的价值体系并更好地对齐给定的安全偏好。实验表明,在多样化数据集上实现了改进的安全性与效果平衡,同时保持了模型性能,为可部署的 MLLM 安全对齐提供了实用解决方案。
引用
@article{arxiv.2511.00509,
title = {Reimagining Safety Alignment with An Image},
author = {Yifan Xia and Guorui Chen and Wenqian Yu and Zhijiang Li and Philip Torr and Jindong Gu},
journal= {arXiv preprint arXiv:2511.00509},
year = {2025}
}