中文

AutoRed:一种自由形式对抗性提示生成框架用于自动红队测试

计算与语言 2025-10-10 v1

摘要

大型语言模型(LLM)的安全性是构建可信赖 AI 应用的关键。现有红队测试方法常依赖 seed 指令,这限制了合成对抗性提示的语义多样性。我们提出 AutoRed,一个无需 seed 指令的自由形式对抗性提示生成框架。AutoRed 包含两个阶段:(1)基于人格的对抗性指令生成,(2)反思循环迭代优化低质量提示。为提高效率,我们引入一个验证器来评估提示的有害性,而无需查询目标模型。使用 AutoRed,我们构建了两个红队数据集——AutoRed-Medium 和 AutoRed-Hard——并评估了八个最先进的 LLM。AutoRed 在攻击成功率和更好泛化性方面均优于现有基线方法。我们的结果凸显了基于 seed 方法的局限性,展示了自由形式红队测试在 LLM 安全评估中的潜力。我们将在不久的将来开源数据集。

关键词

引用

@article{arxiv.2510.08329,
  title  = {AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming},
  author = {Muxi Diao and Yutao Mou and Keqing He and Hanbo Song and Lulu Zhao and Shikun Zhang and Wei Ye and Kongming Liang and Zhanyu Ma},
  journal= {arXiv preprint arXiv:2510.08329},
  year   = {2025}
}