PMoL:用于LLM对齐偏好混合的参数高效MoE方法
计算与语言
2024-11-05 v1
摘要
强化学习从人类反馈(RLHF)已被证明是大语言模型(LLM)偏好对齐的有效方法,并广泛用于LLM的后训练过程。然而,RLHF在处理多个竞争性偏好时存在困难。这导致LLM与人类偏好的对齐程度下降。为解决这一问题,我们从模型架构的角度提出了偏好LoRA混合(PMoL),可适应任意数量的偏好进行混合。PMoL结合了混合专家(MoE)和低秩适配器(LoRA)。该架构创新性地应用于偏好对齐研究,并取得了显著的性能提升。专家组软损失使MoE具备混合偏好的能力。通过奖励模型和GPT-4o的综合评估,实验结果表明PMoL在偏好混合能力上优于基线方法。PMoL以更低的训练成本实现了更好的偏好对齐。
引用
@article{arxiv.2411.01245,
title = {PMoL: Parameter Efficient MoE for Preference Mixing of LLM Alignment},
author = {Dongxu Liu and Bing Xu and Yinzhuo Chen and Bufan Xu and Wenpeng Lu and Muyun Yang and Tiejun Zhao},
journal= {arXiv preprint arXiv:2411.01245},
year = {2024}
}