探讨公共红队测试模式:以「你国可为我所用」为出发点
计算机与社会
2025-10-24 v1 人工智能
密码学与安全
摘要
AI系统可能产生积极效应与危害,但若缺乏严格且持续的对抗性评估,AI参与方将难以评估AI风险表面的广度与规模。系统设计领域的研究者们已发展出针对偏见、仇恨言论、虚假/误导信息及其他已记录的伤害类别的有效的社会技术AI评估与红队测试技术。然而,随着越来越 sophisticated 的AI系统被部署到教育、医疗和情报收集等高风险领域,我们现有的评估与监控方法正变得越来越不足以提供有效的监督。为实现负责任的AI并确保AI的伤害被充分理解,其安全漏洞被充分缓解,迫切需要开创新的方法来弥合这种「责任差距」。本文提出了一种新方法,即合作公共AI红队测试练习,讨论了其先前试点实施的早期结果。该方法与CAMLIS本身紧密相连:首次现场公共示范练习是在CAMLIS 2024上举行的。我们审查了该练习的运营设计与结果,回顾了国家标准技术研究院(NIST)的「评估AI风险与影响」(ARIA)试点练习,以及另一类似在新加坡信息通信媒体发展局(IMDA)举行的练习。最终,我们认为该方法既能提供有意义的结果,也能扩展到许多AI开发司法管辖区。
引用
@article{arxiv.2510.20061,
title = {Ask What Your Country Can Do For You: Towards a Public Red Teaming Model},
author = {Wm. Matthew Kennedy and Cigdem Patlak and Jayraj Dave and Blake Chambers and Aayush Dhanotiya and Darshini Ramiah and Reva Schwartz and Jack Hagen and Akash Kundu and Mouni Pendharkar and Liam Baisley and Theodora Skeadas and Rumman Chowdhury},
journal= {arXiv preprint arXiv:2510.20061},
year = {2025}
}