基于原则驱动、极少人工监督下从零自对齐语言模型
机器学习
2023-12-05 v2 人工智能
计算与语言
计算机与社会
摘要
近期的 AI 助手智能体,如 ChatGPT,主要依赖带人工标注的监督微调(SFT)以及基于人类反馈的强化学习(RLHF)来将大语言模型(LLMs)的输出与人类意图对齐,确保其有帮助、符合伦理且可靠。然而,由于获取人类监督的高成本以及与之相关的质量、可靠性、多样性、自一致性和不良偏差等问题,这种依赖会显著限制 AI 助手智能体的真正潜力。为应对这些挑战,我们提出了一种称为 SELF-ALIGN 的新方法,它结合了原则驱动的推理与 LLM 的生成能力,以在极少人工监督下实现 AI 智能体的自对齐。我们的方法包含四个阶段:首先,我们使用 LLM 生成合成提示,并采用主题引导方法增强提示多样性;其次,我们使用一小套人工编写的原则供 AI 模型遵循,并通过基于示范(原则应用示范)的上下文学习引导 LLM 对用户查询产生有帮助、符合伦理且可靠的响应;第三,我们用高质量的自对齐响应微调原始 LLM,使所得模型无需原则集与示范即可直接为每个查询生成理想响应;最后,我们提供一个精炼步骤以解决响应过于简略或间接的问题。将 SELF-ALIGN 应用于 LLaMA-65b 基础语言模型,我们开发了名为 Dromedary 的 AI 助手。借助少于 300 行人工标注(包括 < 200 个种子提示、16 条通用原则和 5 个上下文学习示例),Dromedary 在多种设置下的基准数据集上显著超越包括 Text-Davinci-003 和 Alpaca 在内的多个最先进 AI 系统。
引用
@article{arxiv.2305.03047,
title = {Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision},
author = {Zhiqing Sun and Yikang Shen and Qinhong Zhou and Hongxin Zhang and Zhenfang Chen and David Cox and Yiming Yang and Chuang Gan},
journal= {arXiv preprint arXiv:2305.03047},
year = {2023}
}
备注
Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary