通过自然语言以数据高效方式将大语言模型与人类反馈对齐
计算与语言
2023-11-27 v1 人工智能
摘要
从人类反馈中学习是一种突出的技术,用于将大语言模型(LLMs)的输出与人类期望对齐。基于人类反馈的强化学习(RLHF)利用以响应对排序形式给出的人类偏好信号来执行这种对齐。然而,人类对 LLM 输出的偏好可以以更丰富的形式出现,包括自然语言,其可对给定响应的优缺点提供详细反馈。在这项工作中,我们研究了以自然语言形式建模人类反馈的数据效率。具体而言,我们在相对少量(1000 条记录或更少)的自然语言人类反馈(以对响应的批评与修订形式)上微调一个开源 LLM,例如 Falcon-40B-Instruct。我们表明,该模型能够通过批评与修订那些响应,提升甚至某些最强 LLM(如 ChatGPT、BARD 和 Vicuna)的响应质量。例如,通过对 ChatGPT 响应进行一次修订迭代,修订后的响应相对于原始响应的胜率为 56.6%,并且在应用五次修订迭代后该胜率可进一步提升至 65.9%。
引用
@article{arxiv.2311.14543,
title = {Data-Efficient Alignment of Large Language Models with Human Feedback Through Natural Language},
author = {Di Jin and Shikib Mehri and Devamanyu Hazarika and Aishwarya Padmakumar and Sungjin Lee and Yang Liu and Mahdi Namazifar},
journal= {arXiv preprint arXiv:2311.14543},
year = {2023}
}
备注
Accepted by Workshop on Instruction Tuning and Instruction Following at NeurIPS 2023, Submitted to AAAI 2024