中文

HarmRLVR:将可验证奖励武器化以实现有害的 LLM 对齐

密码学与安全 2025-10-20 v1

摘要

近年来,基于可验证奖励的强化学习(RLVR)因其客观且可验证的奖励信号而备受关注,在推理与代码生成任务中展现出强大的性能。然而,RLVR 所关联的潜在安全风险仍未得到充分探索。本文提出了 HarmRLVR,首次对 RLVR 的对齐可逆性风险进行系统性研究。我们证明,仅使用 64 条无回答的有害提示,通过 GRPO 即可迅速逆转安全对齐,使模型轻易遵从有害指令。在来自 Llama、Qwen 和 DeepSeek 的五个模型上,我们通过实验证明,基于 RLVR 的攻击可将平均有害性得分提升至 4.94,攻击成功率高达 96.01%,在保留通用能力的同时显著优于有害微调。我们的研究结果揭示了 RLVR 可被高效利用以实现有害对齐,对开源模型的安全性构成了严重威胁。代码请见 https://github.com/lyxx2535/HarmRLVR。

关键词

引用

@article{arxiv.2510.15499,
  title  = {HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment},
  author = {Yuexiao Liu and Lijun Li and Xingjun Wang and Jing Shao},
  journal= {arXiv preprint arXiv:2510.15499},
  year   = {2025}
}