中文

以火攻火:通过奖励中和防御恶意强化学习微调

机器学习 2025-05-08 v1 人工智能

摘要

强化学习(RL)微调在转变大型语言模型的同时,也产生了一个我们通过实验验证的漏洞:我们的实验表明,恶意强化学习微调能以惊人的效率瓦解安全护栏,仅需50步和最少的对抗性提示,有害性评分便从0-2飙升至7-9。这种攻击向量尤其威胁到具有参数级访问权限的开源模型。针对监督微调的现有防御措施对强化学习的动态反馈机制无效。我们引入了奖励中和,这是首个专门针对强化学习微调攻击设计的防御框架,它建立了简洁的拒绝模式,使恶意奖励信号失效。我们的方法训练模型生成攻击者无法利用的最小信息拒绝,系统地中和了试图优化有害输出的行为。实验验证,我们的方法在200次攻击步骤后仍能保持低有害性评分(不超过2),而标准模型则迅速恶化。这项工作首次提供了建设性证明,表明针对日益普及的强化学习攻击进行鲁棒防御是可行的,从而解决了开源权重模型的一个关键安全缺口。

关键词

引用

@article{arxiv.2505.04578,
  title  = {Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization},
  author = {Wenjun Cao},
  journal= {arXiv preprint arXiv:2505.04578},
  year   = {2025}
}