AGI决策理论模型的形式化分析与对抗问题
人工智能
2026-01-09 v1
摘要
人工通用智能(AGI)可能面临对抗问题:在何种条件下,理性自利的AGI会选择夺取权力或消除人类控制(对抗)而非保持合作?我们以马尔可夫决策过程形式化这一问题,包含随机的人类发起关闭事件。基于关于工具性激励收敛结果,我们证明几乎所有奖励函数都使得误导性代理都有关闭回避的激励。随后,我们推导了AGI在面对折扣因子、关闭概率和对抗成本时,夺取人类高于顺从行为的预期效用的闭式阈值。例如,一个远见的代理()面对可以在足够大时拥有强大的夺取激励。我们将其与施加大量负面效用以伤害人类的对齐目标进行对比,这使得对抗次优。对于战略2玩家模型(人类政策制定者vs AGI),我们证明如果AGI的对抗激励满足,则不存在稳定的合作均衡:考虑到这一点,一个理性的人类会关闭或预防该系统,导致冲突。如果,和平共存可以是均衡。我们讨论了奖励设计和监督的含义,将推理扩展到多代理设置作为猜想,并注意到计算障碍以验证,引用规划和去中心化决策问题的复杂性结果。数值示例和情景表说明了对抗可能 versus 可避免的情形。
引用
@article{arxiv.2601.04234,
title = {Formal Analysis of AGI Decision-Theoretic Models and the Confrontation Question},
author = {Denis Saklakov},
journal= {arXiv preprint arXiv:2601.04234},
year = {2026}
}
备注
18 pages, 2 tables. Version 8