利用领域不变奖励模型对齐大语言模型
机器学习
2025-01-03 v1
摘要
在偏好数据不可用的领域,将大语言模型对齐到人类偏好是一项挑战。我们通过利用从较简单的源领域收集的反馈来解决此类目标领域的奖励模型学习问题,在源领域中人类偏好更容易获得。我们的核心见解是,尽管领域可能存在显著差异,但人类偏好传达了可被奖励模型有效捕获的领域无关概念。我们提出了\method,这是一个通过优化双重损失来训练领域不变奖励模型的框架:最小化源分布与目标分布之间差异的领域损失,以及在源领域上优化偏好的源损失。我们展示了\method是一种通用方法,并在4种不同设置下对其进行了评估与分析:(1)跨语言迁移(准确率:),(2)干净到含噪(准确率:),(3)少样本到全量迁移(准确率:),以及(4)简单到复杂任务迁移(相关性:)。我们的代码、模型和数据可在\url{https://github.com/portal-cornell/dial}获取。
引用
@article{arxiv.2501.00911,
title = {Aligning LLMs with Domain Invariant Reward Models},
author = {David Wu and Sanjiban Choudhury},
journal= {arXiv preprint arXiv:2501.00911},
year = {2025}
}