DogeRM:通过模型合并为奖励模型注入领域知识
计算与语言
2024-10-08 v2
摘要
从人类反馈中进行强化学习 (RLHF) 是一种流行的策略,用于将大型语言模型 (LLM) 对齐于所需行为。在 RLHF 中,奖励建模是一个关键步骤。然而,为训练奖励模型收集配对偏好数据往往代价高昂且耗时,尤其是对于需要专家标注的领域特定偏好。为此,我们提出了 \textbf{Do}main knowled\textbf{g}e merged \textbf{R}eward \textbf{M}odel (DogeRM),一种一种通过模型合并将领域特定知识整合到通用奖励模型中的新框架。实验结果表明,DogeRM 在不同基准测试上均实现了性能提升,并提供了详细分析,展示了模型合并的作用效果,凸显了促进模型对齐的巨大潜力。
引用
@article{arxiv.2407.01470,
title = {DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging},
author = {Tzu-Han Lin and Chen-An Li and Hung-yi Lee and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2407.01470},
year = {2024}
}
备注
In the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024). The code for our work is available at: https://github.com/MiuLab/DogeRM