中文

建模变革性 AI 风险(MTAIR)项目——总结报告

人工智能 2022-06-22 v1

摘要

本报告概述了建模变革性 AI 风险(MTAIR)项目的工作,该项目试图梳理关于先进 AI 灾难性风险的辩论中的关键假设、不确定性和分歧,以及它们之间的关系。这建立在 Ben Cottier 和 Rohin Shah 早期的一张图表之上,该图表以可视化方式并辅以一些解释,列出了一些关键分歧(“症结”)。基于广泛的文献综述和与专家的交流,本报告阐释了一个涉及相关议题的模型,以及初始的基于软件的实现,该实现可以纳入概率估计或其他定量因素,以实现探索、规划和/或决策支持。通过将来自各种辩论和讨论的信息汇集到一个更连贯的表述中,我们希望促成关于相关议题的更好讨论和辩论。该模型始于对通过类比进行的推理以及关于人工智能的一般先验信念的讨论。随后,它阐述了一个关于高级机器智能的不同路径和使能技术的模型,以及一个关于这些系统能力进步可能如何进行的模型,包括关于自我改进、非连续性进步,以及分布式、非智能体式高级智能或较慢进步的可能性的辩论。该模型还特别审视了习得性优化问题,以及机器学习系统是否会创建内层优化器(mesa-optimizers)。接着,考察了不同安全研究对前述一系列问题的影响,以理解研究是否以及如何有助于实现更安全的系统。最后,我们讨论了一个关于不同失败模式以及失控或接管的场景的模型。

关键词

引用

@article{arxiv.2206.09360,
  title  = {Modeling Transformative AI Risks (MTAIR) Project -- Summary Report},
  author = {Sam Clarke and Ben Cottier and Aryeh Englander and Daniel Eth and David Manheim and Samuel Dylan Martin and Issa Rice},
  journal= {arXiv preprint arXiv:2206.09360},
  year   = {2022}
}

备注

Chapters were written by authors independently. All authors are listed alphabetically