基于参考答案的学习:无需二元人类偏好数据的通用语言模型对齐
计算与语言
2025-10-14 v3 人工智能
机器学习
摘要
大型语言模型(LLM)被期望具有有用、无害和诚实的特性。在不同的对齐场景中,如安全、置信和通用偏好对齐中,二元偏好数据收集和奖励建模都相当昂贵,但在将人类偏好迁移到模型中发挥核心作用。在本工作中,我们探索了使用抽样生成结果与参考答案之间相似性作为对齐的补充奖励函数。当可获得单值参考答案时,这种基于相似性的奖励可以规避二元偏好数据的需求和显式奖励建模。我们引入了\textit{RefAlign},一种不依赖奖励模型或参考模型的通用REINFORCE风格对齐算法。RefAlign利用语言生成评估指标(如BERTScore)在抽样生成结果与参考答案之间的相似性作为代理奖励。除了通用偏好优化,RefAlign可以自然地扩展到包括安全和置信对齐等多种场景,通过将基于相似性的奖励与任务特定目标相结合。在多个场景中,RefAlign在无需二元偏好数据或奖励模型的情况下实现了与先前对齐方法相当的性能。代码已公开于https://github.com/mzhaoshuai/RefAlign。
引用
@article{arxiv.2504.09895,
title = {Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data},
author = {Shuai Zhao and Yunqiu Xu and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2504.09895},
year = {2025}
}
备注
The code is at https://github.com/mzhaoshuai/RefAlign