基于层次专家的多目标大语言模型对齐
计算与语言
2025-05-28 v1 人工智能
摘要
将大语言模型(LLM)对齐以同时满足多个目标仍然是一个重大挑战,特别是考虑到人类偏好的多样性和经常冲突的性质。现有的对齐方法难以有效平衡权衡,通常需要昂贵的重新训练,或者在偏好的 Pareto 前沿上产生次优结果。在本文中,我们引入了 \textit{HoE}(层次混合专家),这是一种 \textit{轻量级}、\textit{参数高效}且 \textit{即插即用}的方法,它消除了模型训练的需要,同时使 LLM 能够在整个 Pareto 前沿进行适应并容纳多样化的用户偏好。具体而言,\textit{HoE} 由三个层次化组件组成:LoRA 专家、路由专家和偏好路由,达到了最优的 Pareto 前沿,并在参数大小、训练成本和性能之间实现了权衡。我们在 6 个基准上的 14 个目标和 200 种不同偏好下评估了 \textit{HoE} 在各种任务上的表现,证明了其优于 15 个近期基线的性能。代码可在补充材料中获取。
引用
@article{arxiv.2505.20925,
title = {Multi-objective Large Language Model Alignment with Hierarchical Experts},
author = {Zhuo Li and Guodong Du and Weiyang Guo and Yigeng Zhou and Xiucheng Li and Wenya Wang and Fangming Liu and Yequan Wang and Deheng Ye and Min Zhang and Jing Li},
journal= {arXiv preprint arXiv:2505.20925},
year = {2025}
}