中文

AGI决策理论模型的形式化分析与对抗问题

人工智能 2026-01-09 v1

摘要

人工通用智能(AGI)可能面临对抗问题:在何种条件下,理性自利的AGI会选择夺取权力或消除人类控制(对抗)而非保持合作?我们以马尔可夫决策过程形式化这一问题,包含随机的人类发起关闭事件。基于关于工具性激励收敛结果,我们证明几乎所有奖励函数都使得误导性代理都有关闭回避的激励。随后,我们推导了AGI在面对折扣因子γ\gamma、关闭概率pp和对抗成本CC时,夺取人类高于顺从行为的预期效用的闭式阈值。例如,一个远见的代理(γ=0.99\gamma=0.99)面对p=0.01p=0.01可以在CC足够大时拥有强大的夺取激励。我们将其与施加大量负面效用以伤害人类的对齐目标进行对比,这使得对抗次优。对于战略2玩家模型(人类政策制定者vs AGI),我们证明如果AGI的对抗激励满足Δ0\Delta \ge 0,则不存在稳定的合作均衡:考虑到这一点,一个理性的人类会关闭或预防该系统,导致冲突。如果Δ<0\Delta < 0,和平共存可以是均衡。我们讨论了奖励设计和监督的含义,将推理扩展到多代理设置作为猜想,并注意到计算障碍以验证Δ<0\Delta < 0,引用规划和去中心化决策问题的复杂性结果。数值示例和情景表说明了对抗可能 versus 可避免的情形。

关键词

引用

@article{arxiv.2601.04234,
  title  = {Formal Analysis of AGI Decision-Theoretic Models and the Confrontation Question},
  author = {Denis Saklakov},
  journal= {arXiv preprint arXiv:2601.04234},
  year   = {2026}
}

备注

18 pages, 2 tables. Version 8