中文

通过高效多样化响应抽样暴露大语言模型的长尾安全失效

计算与语言 2026-03-17 v1

摘要

通过监督微调和从人类反馈获取强化学习进行的安全调优已显著提高了大语言模型(LLM)的鲁棒性。然而,这往往抑制而非消除不安全行为,使罕见但关键的失效行为隐藏在输出分布的长尾中。虽然大多数红队测试工作强调对抗提示搜索(输入空间优化),但我们表明,通过对固定安全关键提示进行多样化响应生成(输出空间探索),可系统性地暴露安全失效,其中增加抽样响应的数量和多样性可将越狱成功率逼近1。为高效发现此类失效,我们提出渐进式多样化人口抽样(PDPS),其结合了随机标记级抽样与基于多样性的选择,以探索大量候选响应集合并保留紧凑且语义多样化的子集。在多个越狱基准测试和开源LLM上,PDPS在仅使用8%至29%计算成本的情况下,实现了与大规模独立同分布抽样相当的攻击成功率。此外,在受限响应设置下,PDPS相对于独立同分布抽样和多样化束搜索提高了26%至40%的成功率。Furthermore, PDPS生成的响应在不安全输出的数量和多样性方面均表现更佳,证明了其在发现更广泛失效范围方面的有效性。

关键词

引用

@article{arxiv.2603.14355,
  title  = {Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling},
  author = {Suvadeep Hajra and Palash Nandi and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2603.14355},
  year   = {2026}
}