面向对抗训练的 DPO:通过对抗训练提升视觉语言模型的安全对齐
密码学与安全
2025-02-18 v1
摘要
安全对齐在预训练大型语言模型(LLM)以生成符合人类价值观并拒绝有害查询的响应方面至关重要。与 LLM 不同,当前视觉语言模型(VLM)的安全对齐通常通过事后安全微调实现。然而,这些方法对白盒攻击效果较差。为此,我们提出了 ,一种显式考虑对抗性攻击的训练框架。 将对抗训练集成到 DPO 中,以增强 VLM 在最坏情况对抗扰动下的安全对齐。 引入了两个关键组件:(1) 一个经过对抗训练的参考模型,可在最坏情况扰动下生成人类偏好响应,(2) 一个对抗感知 DPO 损失,用于生成考虑对抗扰动的胜负配对。通过整合这些创新点, 确保即使在面对 sophisticated jailbreak 攻击时,VLM 也能保持稳健可靠。大量实验表明, 在 VLM 的安全对齐和通用实用性方面均优于基线方法。
引用
@article{arxiv.2502.11455,
title = {Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training},
author = {Fenghua Weng and Jian Lou and Jun Feng and Minlie Huang and Wenjie Wang},
journal= {arXiv preprint arXiv:2502.11455},
year = {2025}
}