Concordia:面向联邦 LLM 的自改进合成表
机器学习
2026-05-19 v2
摘要
联邦学习 (FL) 能够在不共享原始数据的情况下训练大型语言模型 (LLM),但在严格的数据隔离和非独立同分布 客户端分布下适配 LLM 在实践中仍具挑战。合成数据为本地训练提供了天然的隐私保护替代品,然而现有的联邦流程通常将合成数据生成视为静态的,或与下游优化松散耦合,导致在异构客户端下效用迅速递减。我们研究在表格任务上对 LLM 进行联邦适配,其中原始记录和验证数据无法共享,本地训练必须完全依赖合成表。我们提出 Concordia,一个三层优化框架,尽管存在这些约束,它仍能将合成数据生成与联邦验证效用对齐。在客户端层面,模型通过在合成表上进行参数高效的 LoRA 训练来适配。客户端还从私有验证反馈中学习轻量级效用评分器,以在本地训练期间重新加权合成样本。在外层,每个客户端利用组相对策略优化 (GRPO) 改进其自身的合成表生成器,该过程由跨客户端共享的异构评分器集成作指导,且无需聚合生成器参数或暴露验证数据。在金融和医疗保健领域的隐私敏感表格基准上的实验表明,与静态和解耦的合成数据基线相比,Concordia 持续提升了联邦性能、跨客户端稳定性和对分布偏移的鲁棒性。
引用
@article{arxiv.2605.09855,
title = {Concordia: Self-Improving Synthetic Tables for Federated LLMs},
author = {Jimin Huang and Duanyu Feng and Nuo Chen and Xiaoyu Wang and Zhiqiang Zhang and Xueqing Peng and Mingquan Lin and Prayag Tiwari and Guojun Xiong and Alejandro Lopez-Lira and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2605.09855},
year = {2026}
}
备注
12 pages