Stable-GFlowNet: 通过对比轨迹平衡实现 LLM 红队测试的多样性与鲁棒性
机器学习
2026-05-29 v2
摘要
大型语言模型 (LLM) 红队测试是确保安全性的关键过程,旨在主动识别 LLM 的漏洞。在红队测试中,寻找有效且多样化的攻击方法至关重要,但两者都面临挑战。执行分布匹配的生成流网络 (GFN) 是一种有前景的方法,但因训练不稳定和模式崩溃而备受诟病,特别是红队测试中的不稳定奖励会加剧模式崩溃。我们提出了 Stable-GFN (S-GFN),通过消除分区函数 的估计来降低训练不稳定性。S-GFN 通过两两比较避免 Z 估计,并采用针对噪声奖励的稳健掩码方法。此外,我们提出了一种流畅度稳定器,以防止模型陷入产生胶水代码的局部最优点。S-GFN 在保持 GFN 最优策略的同时提供更稳定的训练。我们在各种设置下展示了 S-GFN 在攻击性能和多样性方面的压倒性优势。
引用
@article{arxiv.2605.00553,
title = {Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance},
author = {Minchan Kwon and Sunghyun Baek and Minseo Kim and Jaemyung Yu and Dongyoon Han and Junmo Kim},
journal= {arXiv preprint arXiv:2605.00553},
year = {2026}
}
备注
ICML 2026 Spotlight