用于AI控制的游戏:AI部署协议安全评估的模型
人工智能
2026-05-08 v2 机器学习
摘要
为了评估不可信AI部署协议的安全性和有用性,AI控制使用在协议设计者和对手之间进行的红队演练。本文引入了AI控制博弈,作为该红队演练的形式化决策模型,它是一种多目标、部分可观测的随机博弈。我们还引入了从AI控制博弈到零和部分可观测随机博弈特例的归约,使我们能够利用现有算法寻找帕累托最优协议。我们将我们的形式化体系应用于对将不可信语言模型部署为编程助手的协议进行建模、评估和综合,重点关注可信监控协议,该协议使用较弱的语言模型和有限的人工协助。为了证明我们形式化体系的效用,我们展示了在现有设置下相对于实证研究的改进,评估了新设置下的协议,并分析了建模假设如何影响协议的安全性和有用性。最后,我们利用我们的形式化体系精确描述了先前控制工作中的一些隐含假设。
引用
@article{arxiv.2409.07985,
title = {Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols},
author = {Charlie Griffin and Louis Thomson and Buck Shlegeris and Alessandro Abate},
journal= {arXiv preprint arXiv:2409.07985},
year = {2026}
}