FedRLHF:一个保证收敛的隐私保护与个性化 RLHF 联邦框架
机器学习
2025-02-11 v2 人工智能
密码学与安全
摘要
在隐私关切日益增强和对个性化体验需求不断增加的时代,传统的基于人类反馈的强化学习(RLHF)框架由于依赖集中式数据而面临重大挑战。我们引入了基于人类反馈的联邦强化学习(FedRLHF),一种将 RLHF 过程去中心化的新颖框架。FedRLHF 支持跨多个客户端的协作式策略学习,而无需共享原始数据或人类反馈,从而确保了稳健的隐私保护。利用联邦强化学习,每个客户端在本地将人类反馈整合到其奖励函数中,并通过个性化的 RLHF 过程更新其策略。我们为 FedRLHF 建立了严格的理论基础,提供了收敛保证,并推导出随客户端数量高效扩展的样本复杂度界限。在 MovieLens 和 IMDb 数据集上的实证评估表明,FedRLHF 不仅保护了用户隐私,还实现了与集中式 RLHF 相当的性能,同时增强了跨不同客户端环境的个性化。
引用
@article{arxiv.2412.15538,
title = {FedRLHF: A Convergence-Guaranteed Federated Framework for Privacy-Preserving and Personalized RLHF},
author = {Flint Xiaofeng Fan and Cheston Tan and Yew-Soon Ong and Roger Wattenhofer and Wei-Tsang Ooi},
journal= {arXiv preprint arXiv:2412.15538},
year = {2025}
}
备注
Updated for AAMAS 2025 camera-ready. This preprint represents the full version of the paper, including all proofs, experimental details, and additional discussions