构建安全高级 AI 的 11 种方案综述
机器学习
2020-12-15 v1 人工智能
摘要
本文在当前机器学习范式下分析并比较了 11 种不同的构建安全高级 AI 的方案,包括迭代放大、通过辩论实现 AI 安全以及递归奖励建模等主要方案。每个方案都从外部对齐、内部对齐、训练竞争力和性能竞争力这四个组成部分进行评估,其中后两者的区分由本文提出。先前文献主要侧重于分析单个方案,或主要以牺牲内部对齐为代价关注外部对齐,而本分析试图对广泛范围的方案进行 comparative 考察,包括对上述全部四个组成部分的 comparative 分析。
引用
@article{arxiv.2012.07532,
title = {An overview of 11 proposals for building safe advanced AI},
author = {Evan Hubinger},
journal= {arXiv preprint arXiv:2012.07532},
year = {2020}
}