中文

为何人工智能安全需要不确定性、不完整的偏好以及非阿基米德效用

人工智能 2025-12-30 v1 计算机科学与博弈论

摘要

如何确保 AI 系统与人类价值观相匹配且保持安全?我们可以通过 AI 辅助游戏和 AI 关机游戏的框架来研究这一问题。AI 辅助问题关乎设计能够帮助人类最大化其效用函数(s)的 AI 智能体。然而,只有人类知道这些函数(s);AI 辅助智能体必须学习这些函数。相反,关机问题关乎设计能够在按下关机按钮时关闭的 AI 智能体;既不尝试防止也不造成关机按钮的按下;同时在其他方面高效完成其任务。本文显示,解决这些挑战需要能够进行不确定性推理并处理不完整和非阿基米德偏好的 AI 智能体。

关键词

引用

@article{arxiv.2512.23508,
  title  = {Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities},
  author = {Alessio Benavoli and Alessandro Facchini and Marco Zaffalon},
  journal= {arXiv preprint arXiv:2512.23508},
  year   = {2025}
}