中文

面向对抗训练的 DPO:通过对抗训练提升视觉语言模型的安全对齐

密码学与安全 2025-02-18 v1

摘要

安全对齐在预训练大型语言模型(LLM)以生成符合人类价值观并拒绝有害查询的响应方面至关重要。与 LLM 不同,当前视觉语言模型(VLM)的安全对齐通常通过事后安全微调实现。然而,这些方法对白盒攻击效果较差。为此,我们提出了 Adversary-aware DPO (ADPO)\textit{Adversary-aware DPO (ADPO)},一种显式考虑对抗性攻击的训练框架。Adversary-aware DPO (ADPO)\textit{Adversary-aware DPO (ADPO)} 将对抗训练集成到 DPO 中,以增强 VLM 在最坏情况对抗扰动下的安全对齐。ADPO\textit{ADPO} 引入了两个关键组件:(1) 一个经过对抗训练的参考模型,可在最坏情况扰动下生成人类偏好响应,(2) 一个对抗感知 DPO 损失,用于生成考虑对抗扰动的胜负配对。通过整合这些创新点,ADPO\textit{ADPO} 确保即使在面对 sophisticated jailbreak 攻击时,VLM 也能保持稳健可靠。大量实验表明,ADPO\textit{ADPO} 在 VLM 的安全对齐和通用实用性方面均优于基线方法。

关键词

引用

@article{arxiv.2502.11455,
  title  = {Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training},
  author = {Fenghua Weng and Jian Lou and Jun Feng and Minlie Huang and Wenjie Wang},
  journal= {arXiv preprint arXiv:2502.11455},
  year   = {2025}
}