中文

人工超智能之路:关于超对齐的全面调查综述

机器学习 2024-12-30 v3

摘要

大型语言模型(LLM)的出现引发了关于人工超智能(ASI)的可能性——一种超越人类智力的假设AI系统。然而,现有的对齐范式难以指导此类高级AI系统。超对齐旨在实现对齐AI系统与人类价值观和安全要求,以超人类水平的能力为目标,旨在解决两个主要目标——scalable oversight以提供高质量指导信号,以及robust governance以确保与人类价值观的对齐。本综述我们检阅超对齐的可扩展监督方法和潜在解决方案。具体而言,我们探讨了ASI的概念、其所提出的挑战以及当前对齐范式在解决超对齐问题方面的局限性。然后我们审阅了用于超对齐的可扩展监督方法。最后,我们讨论了关键挑战并提出了确保ASI系统安全持续改进的路径。通过全面审阅当前文献,旨在提供系统性介绍现有方法,分析其优势与局限性,并讨论潜在的未来方向。

关键词

引用

@article{arxiv.2412.16468,
  title  = {The Road to Artificial SuperIntelligence: A Comprehensive Survey of Superalignment},
  author = {HyunJin Kim and Xiaoyuan Yi and Jing Yao and Jianxun Lian and Muhua Huang and Shitong Duan and JinYeong Bak and Xing Xie},
  journal= {arXiv preprint arXiv:2412.16468},
  year   = {2024}
}