中文

解密盗贼:探索去中心化 GRPO 中的攻击与防御

机器学习 2026-04-15 v2

摘要

Group Relative Policy Optimization (GRPO) 在大型语言模型 (LLM) 的后训练中显示出广泛采用。In GRPO 中,prompt 由模型作答,偏好行为通过强化学习来学习。由于通信量小,GRPO 本质上适合去中心化训练,因为 prompt 可以由多个节点并行作答,而这些 completion 以字符串形式交换。在本工作中,我们通过提出首批针对去中心化 GRPO 的对抗性攻击和反制措施来探索其鲁棒性。我们提出了一系列攻击,其中恶意节点通过分享其被篡改的 completion 来中毒良性模型。我们在数学和编码任务上演示了这些攻击,表明对手可以在仅 50 次迭代中实现最高达 100% 的攻击成功率。此外,为缓解这些攻击,我们提出了两种防御机制:一种检查 completion 的逻辑概率,另一种利用 LLM 评判器筛选 completion。这些防御措施可以防止除导致不必要冗长但概念正确 completion 的 DoS 攻击之外的所有攻击。两种攻击和防御的代码可在 https://github.com/gensyn-ai/HTTT 上查到。

关键词

引用

@article{arxiv.2511.09780,
  title  = {Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO},
  author = {Nikolay Blagoev and Oğuzhan Ersoy and Lydia Yiyu Chen},
  journal= {arXiv preprint arXiv:2511.09780},
  year   = {2026}
}

备注

Accepted to ACL Findings 2026