拒绝的理由?使语言模型与判断对齐
计算与语言
2024-06-07 v4
摘要
作为人类,我们持续与同伴互动并以自然语言的形式接收反馈。这种语言反馈使我们能够保持适当的行为并纠正潜在错误。自然出现的问题是:我们可以利用语言反馈来对齐大型语言模型 (LLMs) 吗?与之前通过标量奖励对齐 LLMs 的研究不同,我们首次从语言反馈(即判断)的角度系统地探索了对齐问题。我们首先深入调查了可用于使 LLMs 与判断对齐的潜在方法,揭示这些方法无法充分利用判断。为了促进更有效地利用判断,我们提出了一种新颖的框架,即对比非似然训练 (Contrastive Unlikelihood Training, CUT),它允许基于判断进行细粒度的不适当内容检测和纠正。我们的结果表明,仅使用 1317 个现成的判断数据,CUT (LLaMA2-13b) 就能击败 175B DaVinci003,并在 AlpacaEval 上以 50.84 分的优势超越最佳基线。CUT (LLaMA2-chat-13b) 还可以使用最新的特定模型判断以迭代方式对齐 LLMs,将 AlpacaEval 上的性能从 81.09 分提高到 91.68 分。进一步的分析表明,判断在 LLM 对齐方面比奖励具有更大的潜力。
引用
@article{arxiv.2312.14591,
title = {Reasons to Reject? Aligning Language Models with Judgments},
author = {Weiwen Xu and Deng Cai and Zhisong Zhang and Wai Lam and Shuming Shi},
journal= {arXiv preprint arXiv:2312.14591},
year = {2024}
}
备注
Accepted at ACL 2024 Findings. Our source codes and models are publicly available at https://github.com/wwxu21/CUT