HarmRLVR:将可验证奖励武器化以实现有害的 LLM 对齐
密码学与安全
2025-10-20 v1
摘要
近年来,基于可验证奖励的强化学习(RLVR)因其客观且可验证的奖励信号而备受关注,在推理与代码生成任务中展现出强大的性能。然而,RLVR 所关联的潜在安全风险仍未得到充分探索。本文提出了 HarmRLVR,首次对 RLVR 的对齐可逆性风险进行系统性研究。我们证明,仅使用 64 条无回答的有害提示,通过 GRPO 即可迅速逆转安全对齐,使模型轻易遵从有害指令。在来自 Llama、Qwen 和 DeepSeek 的五个模型上,我们通过实验证明,基于 RLVR 的攻击可将平均有害性得分提升至 4.94,攻击成功率高达 96.01%,在保留通用能力的同时显著优于有害微调。我们的研究结果揭示了 RLVR 可被高效利用以实现有害对齐,对开源模型的安全性构成了严重威胁。代码请见 https://github.com/lyxx2535/HarmRLVR。
引用
@article{arxiv.2510.15499,
title = {HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment},
author = {Yuexiao Liu and Lijun Li and Xingjun Wang and Jing Shao},
journal= {arXiv preprint arXiv:2510.15499},
year = {2025}
}