中文

审视 AI 审查之外的 AI 审查

人工智能 2025-11-03 v2 密码学与安全 计算机与社会

摘要

Red teaming(红队)从军事应用的起源发展至今天在网络安全与人工智能领域广泛采用。本文对 AI 红队实践进行批判性审视。我们认为,尽管 AI 红队在 AI 治理中备受推崇,但其原始意图作为批判性思维练习与其在生成式人工智能中仅聚焦模型层面缺陷的狭窄范围之间存在显著差距。当前的 AI 红队工作主要关注单个模型的脆弱性,却忽视了模型、用户与环境之间复杂交互所产生的更广泛的社会技术系统与涌现行为。为弥补这一不足,我们提出了一个在两个层面操作化 AI 系统红队的综合框架:宏观层面的系统红队涵盖整个 AI 开发生命周期,以及微观层面的模型红队。结合网络安全经验与系统论,我们进一步提出六项建议。我们强调,有效的 AI 红队需要跨职能团队,考察涌现风险、系统性脆弱性以及技术与社会因素之间的相互作用。

关键词

引用

@article{arxiv.2507.05538,
  title  = {Red Teaming AI Red Teaming},
  author = {Subhabrata Majumdar and Brian Pendleton and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2507.05538},
  year   = {2025}
}

备注

Conference on Applied Machine Learning for Information Security (CAMLIS) 2025