中文

大规模经验性案例研究:为AI红队测试适配Go-Explore

密码学与安全 2026-01-07 v2 人工智能 机器学习

摘要

具有工具使用能力的生产LLM代理需要进行安全测试,尽管已接受过安全训练。我们将Go-Explore适用于评估GPT-4o-mini,进行28次实验运行,涵盖六个研究问题。我们发现随机种子方差主导算法参数,导致结果呈现8倍的差异;单随机种子的比较不可靠,而多随机种子平均显著减少了我们实验 setup中的方差。奖励塑形一致地损害性能,在94%的运行中导致探索崩溃或产生18个零验证攻击的误报。在我们的环境中,简单状态签名优于复杂签名。对于全面的安全测试,ensemble提供攻击类型多样性,而单个代理在给定攻击类型的覆盖方面进行优化。总体而言,这些结果表明,种子方差和针对性领域知识可以超过算法复杂性在测试安全训练模型时具有更大的影响。

关键词

引用

@article{arxiv.2601.00042,
  title  = {Large Empirical Case Study: Go-Explore adapted for AI Red Team Testing},
  author = {Manish Bhatt and Adrian Wood and Idan Habler and Ammar Al-Kahfah},
  journal= {arXiv preprint arXiv:2601.00042},
  year   = {2026}
}