基于堆栈利贝尔安全博弈的激励感知 AI 安全:资源分配视角
人工智能
2026-02-10 v1
摘要
随着 AI 系统变得更加强大和自主,确保其安全和可靠性不仅需要模型层面的对齐,还需要对参与其开发和部署的人以及机构进行战略性监督。现有的安全框架大致将对齐视为静态优化问题(例如,通过调整模型以实现所需行为),而忽略了塑造数据收集、模型评估以及最终部署方式的动态、对抗性激励。我们提出了一种新的 AI 安全视角,基于堆栈利贝尔安全博弈 (SSGs):这是一类为不确定性下的对抗性资源分配设计的博弈论模型。将 AI 监督视为防御者(审计员、评估员和部署者)与攻击者(恶意行为者、不对齐的贡献者或最坏情况的失效模式)之间的战略互动,SSGs 提供了一个统一的框架,用于推理激励设计、有限监督能力以及横跨 AI 生命周期的对抗性不确定性。我们说明了这一框架如何指导 (1) 针对数据/反馈投毒的训练时审计、(2) 在资源有限的评估器资源下的预部署评估,以及 (3) 面对对抗环境的鲁棒多模型部署。这种综合将算法对齐与制度监督设计相结合,突显了博弈论制裁如何使 AI 监督具有前瞻性、风险意识并抵御操纵。
引用
@article{arxiv.2602.07259,
title = {Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective},
author = {Cheol Woo Kim and Davin Choo and Tzeh Yuan Neoh and Milind Tambe},
journal= {arXiv preprint arXiv:2602.07259},
year = {2026}
}