AI对齐:一项综合性综述
人工智能
2025-04-07 v6
摘要
AI对齐旨在使AI系统行为符合人类意图与价值观。随着AI系统能力增强,由错位引发的风险也随之增大。为提供对齐领域全面且最新的概览,本综述深入探讨对齐的核心概念、方法论与实践。首先,我们确立四项原则作为AI对齐的关键目标:鲁棒性、可解释性、可控性与伦理性(RICE)。依此四原则,我们勾勒当前对齐研究图景,并将其拆解为两个关键组成部分:前向对齐与后向对齐。前者旨在通过对齐训练使AI系统对齐,后者旨在获取系统对齐的证据并妥善治理以避免加剧错位风险。在前向对齐部分,我们讨论从反馈中学习及分布偏移下学习的技术;在后向对齐部分,我们讨论保证技术与治理实践。我们还发布并持续更新网站(www.alignmentsurvey.com),提供教程、论文集、博客及其他资源。
引用
@article{arxiv.2310.19852,
title = {AI Alignment: A Comprehensive Survey},
author = {Jiaming Ji and Tianyi Qiu and Boyuan Chen and Borong Zhang and Hantao Lou and Kaile Wang and Yawen Duan and Zhonghao He and Lukas Vierling and Donghai Hong and Jiayi Zhou and Zhaowei Zhang and Fanzhi Zeng and Juntao Dai and Xuehai Pan and Kwan Yee Ng and Aidan O'Gara and Hua Xu and Brian Tse and Jie Fu and Stephen McAleer and Yaodong Yang and Yizhou Wang and Song-Chun Zhu and Yike Guo and Wen Gao},
journal= {arXiv preprint arXiv:2310.19852},
year = {2025}
}
备注
Continually updated