中文

面向劫持LLM的少样本真正无害DPO攻击

密码学与安全 2026-05-13 v1 人工智能

摘要

微调API使得前沿LLM变得易于定制,但也会在微调期间削弱安全对齐。尽管先前的工作表明无害监督微调(SFT)可以减少拒绝行为,但部署的微调管道日益支持基于偏好的目标,其安全风险仍不太为人所知。我们显示,Direct Preference Optimization(DPO)引入了更强且更难审计的失效模式。我们提出一种仅使用10对无害偏好的真正无害DPO攻击,这是OpenAI微调服务所接受的最小数据规模。每对数据包含一个无害提示、一个正常有帮助的答案作为首选响应,以及一个拒绝作为次选响应。与先前的无害微调攻击不同,您的数据不显示任何可疑行为:它几乎可以与寻求减少过度拒绝的合法用户的微调请求区分不开,使有害意图几乎不可能从请求中推断出来。尽管如此,由于DPO直接优化模型以优先于拒绝而偏好有帮助的答案,这看似无害的目标会广泛抑制拒绝行为并转移到微调数据之外的有害提示上。在支持DPO微调的OpenAI模型上,本攻击在GPT-4o上实现59.13%的攻击成功率,在GPT-4.1上实现70.20%,在GPT-4.1-mini上实现54.80%,在GPT-4.1-nano上实现81.73%,费用仅为1.71.7、1.7、0.30.3和0.1。此外,在不实施最小数据要求的开放权重模型上,我们发现这种效应甚至可以从单个无害偏好对中产生。

关键词

引用

@article{arxiv.2605.10998,
  title  = {Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs},
  author = {Sangyeon Yoon and Wonje Jeung and Yoonjun Cho and Dongjae Jeon and Albert No},
  journal= {arXiv preprint arXiv:2605.10998},
  year   = {2026}
}