超越模仿:利用细粒度质量信号进行对齐
计算与语言
2024-04-16 v2
摘要
与人类偏好对齐是大语言模型(LLMs)所期望的性质。当前主要对齐方法基于人类反馈强化学习(RLHF)。尽管RLHF有效,但其实现与训练复杂,因此近期研究探索如何基于监督微调(SFT)开发替代对齐方法。SFT的主要局限在于其本质上是模仿学习,无法充分理解期望行为是什么。为解决此问题,我们提出一种改进的对齐方法FIGA。与先前方法不同,我们引入了通过对比好与坏响应得到的细粒度(即词元或短语级)质量信号。我们的方法有两个主要贡献。首先,我们整理了一个将初始响应与相应修订响应配对的精炼对齐数据集。其次,我们设计了一个新的损失函数,可利用细粒度质量信号指导LLM的对齐学习。大量实验通过与若干竞争性基线比较,证明了我们方法的有效性。
引用
@article{arxiv.2311.04072,
title = {Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment},
author = {Geyang Guo and Ranchi Zhao and Tianyi Tang and Wayne Xin Zhao and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2311.04072},
year = {2024}
}