监督游戏:学习在AI代理的安全性与自主性之间协调
人工智能
2026-02-23 v2 机器学习
摘要
随着越来越有能力的代理被部署,一个核心安全挑战是如何在不修改底层系统的情况下保持有意义的人类控制。我们研究了一种最小控制界面,其中代理选择是自主行动(玩)还是退让(询问),而人类同时选择是包容(信任)还是进行监督(监视),并将此交互建模为双人马尔可夫游戏。当该游戏形成马尔可夫潜在游戏时,我们证明了一种对齐保证:代理因更自主行动而获得的效用增加不能降低人的价值。这建立了一种内在对齐形式,其中代理寻求自主性的动机在结构上与人的福祉相耦合。实际上,该框架诱导了一个透明的控制层,鼓励代理在风险较高时退让,在安全时行动。虽然我们使用网格世界模拟来说明这种合作的出现,但我们的主要验证涉及代理工具使用任务,其中两个30B参数语言模型通过独立策略梯度进行微调。我们展示了即使代理在现场协调,本框架有效地减少了在现实、开放式环境中的安全违规。
引用
@article{arxiv.2510.26752,
title = {The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy},
author = {William Overman and Mohsen Bayati},
journal= {arXiv preprint arXiv:2510.26752},
year = {2026}
}