比较需要有效的测量:重新审视 AI 红队测试中攻击成功率比较
机器学习
2026-01-27 v1
摘要
我们认为,通过 AI 红队测试得出的关于相对系统安全性或攻击方法有效性的结论,往往得不到攻击成功率(ASR)比较所提供证据的支持。我们通过概念、理论和实证贡献表明,许多结论建立在不可比较或低效度测量的基础之上。我们的论点基于一个简单的问题:何时才能有意义地比较攻击成功率?为了回答这个问题,我们借鉴了社会科学测量理论和推断统计学的思想,这些思想综合起来为理解通过对系统属性量化获得的数值何时能被有意义地比较提供了概念基础。透过这一视角,我们阐明了 ASR 能够和不能够被有意义比较的条件。以越狱作为贯穿示例,我们提供了关于不可比较的 ASR 比较和测量效度挑战的示例与广泛讨论。
引用
@article{arxiv.2601.18076,
title = {Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming},
author = {Alexandra Chouldechova and A. Feder Cooper and Solon Barocas and Abhinav Palia and Dan Vann and Hanna Wallach},
journal= {arXiv preprint arXiv:2601.18076},
year = {2026}
}