面向大语言模型的聚合客户端偏好联邦RLHF
计算与语言
2025-04-10 v3 分布式、并行与集群计算
机器学习
摘要
强化学习与人类反馈(RLHF)使用用户偏好数据微调预训练的大型语言模型(LLM),使其能够生成符合人类偏好的内容。然而,由于隐私 concerns,用户可能不愿意共享敏感的偏好数据。为此,我们提出利用联邦学习(FL)技术,从 diverse 真实用户中大规模收集偏好,而无需将数据传输到中央服务器。我们的联邦RLHF方法(即FedBis和FedBiscuit)将每个客户端的偏好编码为二进制选择器并对其进行聚合以捕获 common 偏好。特别是,FedBiscuit通过创新解决方案克服了关键挑战,例如偏好异构性和奖励攻击,包括对具有类似偏好的客户端进行分组以减少异构性以及使用多个二进制选择器来提高LLM输出质量。为评估所提出方法的性能,我们建立了第一个联邦RLHF基准,包含异构的人类偏好数据集。实验结果表明,通过将LLM与聚合的客户端偏好集成,FedBis和FedBiscuit显著提高了生成内容的专业性和可读性。
引用
@article{arxiv.2407.03038,
title = {Towards Federated RLHF with Aggregated Client Preference for LLMs},
author = {Feijie Wu and Xiaoze Liu and Haoyu Wang and Xingchen Wang and Lu Su and Jing Gao},
journal= {arXiv preprint arXiv:2407.03038},
year = {2025}
}
备注
ICLR'25