中文

通过自然语言以数据高效方式将大语言模型与人类反馈对齐

计算与语言 2023-11-27 v1 人工智能

摘要

从人类反馈中学习是一种突出的技术,用于将大语言模型(LLMs)的输出与人类期望对齐。基于人类反馈的强化学习(RLHF)利用以响应对排序形式给出的人类偏好信号来执行这种对齐。然而,人类对 LLM 输出的偏好可以以更丰富的形式出现,包括自然语言,其可对给定响应的优缺点提供详细反馈。在这项工作中,我们研究了以自然语言形式建模人类反馈的数据效率。具体而言,我们在相对少量(1000 条记录或更少)的自然语言人类反馈(以对响应的批评与修订形式)上微调一个开源 LLM,例如 Falcon-40B-Instruct。我们表明,该模型能够通过批评与修订那些响应,提升甚至某些最强 LLM(如 ChatGPT、BARD 和 Vicuna)的响应质量。例如,通过对 ChatGPT 响应进行一次修订迭代,修订后的响应相对于原始响应的胜率为 56.6%,并且在应用五次修订迭代后该胜率可进一步提升至 65.9%。

关键词

引用

@article{arxiv.2311.14543,
  title  = {Data-Efficient Alignment of Large Language Models with Human Feedback Through Natural Language},
  author = {Di Jin and Shikib Mehri and Devamanyu Hazarika and Aishwarya Padmakumar and Sungjin Lee and Yang Liu and Mahdi Namazifar},
  journal= {arXiv preprint arXiv:2311.14543},
  year   = {2023}
}

备注

Accepted by Workshop on Instruction Tuning and Instruction Following at NeurIPS 2023, Submitted to AAAI 2024