中文

超越模仿:利用细粒度质量信号进行对齐

计算与语言 2024-04-16 v2

摘要

与人类偏好对齐是大语言模型(LLMs)所期望的性质。当前主要对齐方法基于人类反馈强化学习(RLHF)。尽管RLHF有效,但其实现与训练复杂,因此近期研究探索如何基于监督微调(SFT)开发替代对齐方法。SFT的主要局限在于其本质上是模仿学习,无法充分理解期望行为是什么。为解决此问题,我们提出一种改进的对齐方法FIGA。与先前方法不同,我们引入了通过对比好与坏响应得到的细粒度(即词元或短语级)质量信号。我们的方法有两个主要贡献。首先,我们整理了一个将初始响应与相应修订响应配对的精炼对齐数据集。其次,我们设计了一个新的损失函数,可利用细粒度质量信号指导LLM的对齐学习。大量实验通过与若干竞争性基线比较,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2311.04072,
  title  = {Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment},
  author = {Geyang Guo and Ranchi Zhao and Tianyi Tang and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2311.04072},
  year   = {2024}
}