中文

Stable-GFlowNet: 通过对比轨迹平衡实现 LLM 红队测试的多样性与鲁棒性

机器学习 2026-05-29 v2

摘要

大型语言模型 (LLM) 红队测试是确保安全性的关键过程,旨在主动识别 LLM 的漏洞。在红队测试中,寻找有效且多样化的攻击方法至关重要,但两者都面临挑战。执行分布匹配的生成流网络 (GFN) 是一种有前景的方法,但因训练不稳定和模式崩溃而备受诟病,特别是红队测试中的不稳定奖励会加剧模式崩溃。我们提出了 Stable-GFN (S-GFN),通过消除分区函数 ZZ 的估计来降低训练不稳定性。S-GFN 通过两两比较避免 Z 估计,并采用针对噪声奖励的稳健掩码方法。此外,我们提出了一种流畅度稳定器,以防止模型陷入产生胶水代码的局部最优点。S-GFN 在保持 GFN 最优策略的同时提供更稳定的训练。我们在各种设置下展示了 S-GFN 在攻击性能和多样性方面的压倒性优势。

关键词

引用

@article{arxiv.2605.00553,
  title  = {Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance},
  author = {Minchan Kwon and Sunghyun Baek and Minseo Kim and Jaemyung Yu and Dongyoon Han and Junmo Kim},
  journal= {arXiv preprint arXiv:2605.00553},
  year   = {2026}
}

备注

ICML 2026 Spotlight