中文

迈向 AI-$45^{\circ}$ 定律:通向可信 AGI 的路线图

计算机与社会 2024-12-24 v2 人工智能 计算与语言 机器学习

摘要

确保通用人工智能(AGI)可靠地避免有害行为是一项关键挑战,特别是对于具有高自主性或处于安全关键领域的系统。尽管已有各种安全保证提案和极端风险警告,但平衡 AI 安全性与能力的全面指南仍然缺乏。在本立场论文中,我们提出将 \textit{AI-\textbf{4545^{\circ}} 定律}作为通向可信 AGI 的平衡路线图的指导原则,并引入 \textit{可信 AGI 的因果阶梯}作为实用框架。该框架受 Judea Pearl 的“因果阶梯”启发,为当前的 AI 能力和安全研究提供了系统的分类法和层次结构。因果阶梯包含三个核心层:近似对齐层、可干预层和可反思层。这些层解决了 AGI 和当代 AI 系统在安全性和可信度方面的关键挑战。在此框架的基础上,我们定义了可信 AGI 的五个层级:感知、推理、决策、自主性和协作可信度。这些层级代表了可信 AGI 的不同但渐进的方面。最后,我们提出了一系列潜在的治理措施,以支持可信 AGI 的发展。

关键词

引用

@article{arxiv.2412.14186,
  title  = {Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI},
  author = {Chao Yang and Chaochao Lu and Yingchun Wang and Bowen Zhou},
  journal= {arXiv preprint arXiv:2412.14186},
  year   = {2024}
}