超人类智能与大型语言模型的超对齐
计算与语言
2024-12-24 v2
摘要
由于大型语言模型和多模态语言模型的快速发展,我们见证了超人类智能。随着这种超人类模型的应用越来越普遍,一个关键问题出现了:我们如何确保超人类模型仍然安全、可靠并与人类价值观良好对齐?在这篇立场论文中,我们从学习角度讨论超对齐的概念,通过概述从大规模预训练、监督微调到对齐训练的学习范式转变来回答这个问题。我们将超对齐定义为设计有效且高效的对齐算法,以可扩展的方式从噪声标记数据(逐点样本或成对偏好数据)中学习,当任务对人类专家来说变得非常复杂难以标注且模型比人类专家更强时。我们强调了超对齐中的一些关键研究问题,即弱到强泛化、可扩展监督和评估。然后,我们提出了一个超对齐的概念框架,该框架由三个模块组成:一个攻击者,生成对抗性查询以试图暴露学习模型的弱点;一个学习者,通过从批评者模型生成的可扩展反馈以及最少的人类专家反馈来完善自身;以及一个批评者,为给定的查询-响应对生成批评或解释,旨在通过批评改进学习者。我们讨论了该框架每个组件中的一些重要研究问题,并强调了一些与我们提出的框架密切相关的研究思路,例如自对齐、自博弈、自精炼等。最后,我们强调了超对齐的一些未来研究方向,包括识别新的新兴风险和多维对齐。
引用
@article{arxiv.2412.11145,
title = {The Superalignment of Superhuman Intelligence with Large Language Models},
author = {Minlie Huang and Yingkang Wang and Shiyao Cui and Pei Ke and Jie Tang},
journal= {arXiv preprint arXiv:2412.11145},
year = {2024}
}
备注
Under review of Science China