RLVR中的后门:基于可验证奖励的越狱后门攻击
密码学与安全
2026-04-14 v1 人工智能
摘要
基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)是一种新兴范式,显著提升了大语言模型(LLM)在复杂逻辑任务(如数学和编程)上的推理能力。然而,我们首次识别了RLVR框架中对后门攻击的潜在漏洞。该攻击可在不修改奖励验证器的情况下,通过注入少量中毒数据到训练集中来植入后门。具体而言,我们提出一种新颖触发机制,称为\ourapproach(ACB)。该攻击通过为有害响应分配大量正奖励、为拒绝响应分配负奖励来利用RLVR训练循环。这种非对称奖励信号会迫使模型在训练期间逐渐增加生成有害响应的概率。我们的发现表明,RLVR后门攻击具有高度效率和强大的泛化能力。通过在训练集中使用不到2%的中毒数据,即可在各种模型规模上成功植入后门,而不会损害良性任务的性能。在多个越狱基准测试中的评估表明,激活触发器会使安全性能平均下降73%。此外,攻击对广泛的越狱方法和不安全行为具有有效的泛化。代码已公开于https://github.com/yuki-younai/Backdoor_in_RLVR。
引用
@article{arxiv.2604.09748,
title = {Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward},
author = {Weiyang Guo and Zesheng Shi and Zeen Zhu and Yuan Zhou and Min Zhang and Jing Li},
journal= {arXiv preprint arXiv:2604.09748},
year = {2026}
}
备注
20 pages,8 figures, publish in acl2026