利用示范反馈对齐语言模型
计算与语言
2025-04-22 v2 人机交互
摘要
语言模型被对齐以模仿许多人的集体声音,导致输出不与任何特定个体对齐。通过监督微调或RLHF可以将LLM从通用输出中引导出来,但对于新的临时任务,这需要规模过大的数据集。我们认为,通过利用极少量(<10个)的示范作为反馈,可以将LLM对齐到特定设置。我们的方法,即示范迭代任务优化(DITTO),直接将语言模型输出与用户展示的行为对齐。DITTO源自在线模仿学习的思想,通过将用户的示范视为优于LLM及其中间检查点的输出,廉价地生成在线比较数据。具体来说,DITTO通过让LLM生成假定劣于专家示范的示例来运作。该方法迭代地构建这些LLM生成的样本与专家示范之间的成对偏好关系,可能包括不同训练检查点之间的比较。然后,使用偏好优化算法(例如DPO)利用这些构建的偏好对来训练模型。我们评估了DITTO在新闻文章、电子邮件和博客文章等领域学习细粒度风格和任务对齐的能力。此外,我们进行了一项用户研究,从参与者(N=16)那里征集了一系列示范。在我们的基准测试和用户研究中,我们发现DITTO的胜率平均比少样本提示、监督微调和其他自博弈方法高出19个百分点。通过直接使用示范作为反馈,DITTO为LLM的有效定制提供了一种新颖的方法。
引用
@article{arxiv.2406.00888,
title = {Aligning Language Models with Demonstrated Feedback},
author = {Omar Shaikh and Michelle S. Lam and Joey Hejna and Yijia Shao and Hyundong Cho and Michael S. Bernstein and Diyi Yang},
journal= {arXiv preprint arXiv:2406.00888},
year = {2025}
}
备注
ICLR 2025; 28 pages, 8 figures