迈向大规模语言模型的可扩展自动化对齐:综述
计算与语言
2024-09-04 v3 人工智能
机器学习
摘要
对齐是构建满足人类需求的大规模语言模型(LLMs)中最关键的步骤。随着快速发展的LLMs逐渐超越人类能力,基于人工标注的传统对齐方法日益无法满足可扩展性需求。因此,迫切需要探索新的自动化对齐信号来源和技术途径。本文系统性地回顾了近期涌现的自动化对齐方法,试图探索如何在LLMs能力超越人类后实现有效、可扩展的自动化对齐。具体而言,我们根据对齐信号的来源将现有自动化对齐方法分为四大类,并讨论了每一类的现状和潜在发展。此外,我们探讨了实现自动化对齐的底层机制,并从对齐的基本作用出发,讨论了使自动化对齐技术可行且有效的关键因素。
引用
@article{arxiv.2406.01252,
title = {Towards Scalable Automated Alignment of LLMs: A Survey},
author = {Boxi Cao and Keming Lu and Xinyu Lu and Jiawei Chen and Mengjie Ren and Hao Xiang and Peilin Liu and Yaojie Lu and Ben He and Xianpei Han and Le Sun and Hongyu Lin and Bowen Yu},
journal= {arXiv preprint arXiv:2406.01252},
year = {2024}
}
备注
Paper List: https://github.com/cascip/awesome-auto-alignment