中文

联邦RLHF中偏好聚合的系统性评估:实现LLM的多元对齐

计算与语言 2025-12-17 v2 人工智能

摘要

本文解决了在联邦学习(FL)环境中将大语言模型(LLM)与多样化人类偏好对齐的挑战,其中标准方法通常无法充分代表多元观点。我们引入了一个全面的评估框架,系统性地评估在使用不同聚合策略进行人类偏好聚合时对齐质量与公平性之间的权衡。在我们的联邦设置中,每个组本地评估rollout并产生奖励信号,服务器在不访问任何原始数据的情况下聚合这些组级奖励。具体而言,我们评估了标准奖励聚合技术(最小值、最大值和平均值),并引入了一种新颖的自适应方案,根据组的历史对齐表现动态调整偏好权重。我们在基于PPO的RLHF管道上的问答(Q/A)任务实验中证明,自适应方法在保持有竞争力的对齐分数的同时持续实现了优越的公平性。这项工作为评估LLM在多元群体中的行为提供了稳健的方法论,并为开发真正多元且公平对齐的模型提供了实用解决方案。

关键词

引用

@article{arxiv.2512.08786,
  title  = {A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs},
  author = {Mahmoud Srewa and Tianyu Zhao and Salma Elmalaki},
  journal= {arXiv preprint arXiv:2512.08786},
  year   = {2025}
}

备注

This paper is accepted at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle