Q-Adapter:以缓解遗忘的方式将预训练 LLM 定制为新偏好
机器学习
2025-03-04 v4
摘要
在海量语料上训练的大型语言模型 (LLMs) 展现出了卓越的能力。然而,直接将 Llama 等开源 LLM 应用于某些现实场景可能并不充分,因为它们大多数是为通用目的而训练的。因此,定制公开可用 LLM 的需求应运而生,但目前对此研究尚不充分。在本工作中,我们考虑用新的人类偏好来定制预训练 LLM。具体而言,LLM 不仅应满足新偏好,还应在定制后保留其原有能力。受人类偏好可以表示为奖励模型这一观察的启发,我们提出将 LLM 定制转化为优化两个奖励函数之和,其中一个(记为 )用于预训练 LLM,而另一个(记为 )表征新的人类偏好。此处的障碍在于两个奖励函数都是未知的,使得现代强化学习方法无法应用。得益于残差 Q-learning 框架,我们可以在没有奖励函数 的情况下,用预训练 LLM 和残差 Q 函数恢复定制后的 LLM。此外,我们发现对于固定的预训练 LLM,奖励函数 可以从残差 Q 函数中导出,这使我们能够基于 Bradley-Terry 模型直接从新的人类偏好数据中学习残差 Q 函数。我们将我们的方法命名为 Q-Adapter,因为它引入了一个适配器模块来近似残差 Q 函数,从而将预训练 LLM 定制为新偏好。基于 Llama-3.1 模型在 DSP 数据集和 HH-RLHF 数据集上的实验表明,Q-Adapter 在保留现有知识和学习新偏好方面均具有卓越的有效性。代码可在 https://github.com/mansicer/Q-Adapter 获取。
引用
@article{arxiv.2407.03856,
title = {Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation},
author = {Yi-Chen Li and Fuxiang Zhang and Wenjie Qiu and Lei Yuan and Chengxing Jia and Zongzhang Zhang and Yang Yu and Bo An},
journal= {arXiv preprint arXiv:2407.03856},
year = {2025}
}
备注
Camera ready version of ICLR 2025