中文

面向系统级安全的红队测试路线图

密码学与安全 2025-06-10 v2 人工智能

摘要

大型语言模型(LLM)安全措施通过实施请求拒绝策略,已成为防止滥用的最常用缓解方法。然而,在对抗机器学习和AI安全的交叉领域,针对基于拒绝训练的LLM的红队测试有效识别了关键漏洞。然而我们认为,众多会议提交关于LLM红队测试的聚合结果,并未优先考虑正确的研究问题。首先,针对清晰产品安全规范的测试应优先于抽象的社会偏见或伦理原则。其次,红队测试应优先考虑真实威胁模型,这些模型代表不断扩大的风险景观以及真实攻击者可能采取的行动。最后,我们认为,系统级安全是推动红队测试研究前进的必要步骤,因为AI模型在部署上下文中会呈现新的威胁,同时也为威胁缓解提供了机会(例如检测和禁止恶意用户)。采取这些优先事项将是必要的,以便红队测试研究充分应对当今和将来不久的快速AI进步所带来的新威胁。

关键词

引用

@article{arxiv.2506.05376,
  title  = {A Red Teaming Roadmap Towards System-Level Safety},
  author = {Zifan Wang and Christina Q. Knight and Jeremy Kritz and Willow E. Primack and Julian Michael},
  journal= {arXiv preprint arXiv:2506.05376},
  year   = {2025}
}