前沿模型的破坏性能力评估
机器学习
2024-10-30 v1 人工智能
计算机与社会
摘要
能力足够强大的模型可能会在重要情境中颠覆人类的监督和决策。例如,在AI开发的背景下,模型可能暗中破坏评估其自身危险能力、监控其行为或就其部署做出决策的努力。我们将这类能力统称为破坏性能力。我们开发了一套相关的威胁模型和评估方法。这些评估旨在提供证据,证明在给定的一组缓解措施下运行的特定模型,无法以上述任何一种方式成功破坏前沿模型开发机构或其他大型组织的活动。我们在Anthropic的Claude 3 Opus和Claude 3.5 Sonnet模型上演示了这些评估。我们的结果表明,对于这些模型而言,目前最低限度的缓解措施足以应对破坏风险,但随着能力的提升,似乎很快可能需要更真实的评估和更强的缓解措施。我们还调查了尝试过但放弃的相关评估。最后,我们讨论了缓解措施感知能力评估以及利用小规模统计模拟大规模部署的优势。
引用
@article{arxiv.2410.21514,
title = {Sabotage Evaluations for Frontier Models},
author = {Joe Benton and Misha Wagner and Eric Christiansen and Cem Anil and Ethan Perez and Jai Srivastav and Esin Durmus and Deep Ganguli and Shauna Kravec and Buck Shlegeris and Jared Kaplan and Holden Karnofsky and Evan Hubinger and Roger Grosse and Samuel R. Bowman and David Duvenaud},
journal= {arXiv preprint arXiv:2410.21514},
year = {2024}
}