中文

人工智能代理是否默认追求权力?

人工智能 2025-06-10 v1 计算机与社会

摘要

关于来自先进AI的灾难性风险的研究人员已主张,我们应该期待足够强大的AI代理追求对人类的权力,因为权力是一种收敛的仪器目标,这种目标对广泛的最终目标都有用。其他人最近对这些抱怨表示怀疑。本文旨在在抽象的决策论框架中形式化仪器收敛和权力寻求的概念,并评估权力是否是收敛的仪器目标的说法。我得出结论,这一说法至少包含一定的真实性,但可能具有有限的预测效用,因为在缺乏关于代理最终目标的实质性信息时,代理的选项无法始终按照权力进行排序。然而,仪器收敛的事实对于拥有获取绝对或近乎绝对权力的代理更具预测性。

关键词

引用

@article{arxiv.2506.06352,
  title  = {Will artificial agents pursue power by default?},
  author = {Christian Tarsney},
  journal= {arXiv preprint arXiv:2506.06352},
  year   = {2025}
}