中文

探索大型语言模型在联邦学习中跨客户端训练数据记忆

机器学习 2026-05-08 v2 计算与语言

摘要

联邦学习 (FL) 使能够在不共享原始数据的情况下进行协作训练,但仍面临训练数据记忆的风险。现有FL记忆检测技术侧重于逐个样本,低估了跨样本记忆的更微妙风险。相比之下,集中式学习 (CL) 的近期工作引入了细粒度方法来评估训练数据中所有样本的记忆情况,但这些方法假设能够集中访问数据,无法直接应用于FL。我们通过提出一种框架来量化FL中基于所有客户端进行的细粒度跨样本记忆测量,来弥合这一差距。该框架用于量化FL中的内客户端记忆和跨客户端记忆。基于此框架,我们进行了两个研究:(1)测量跨客户端的细微记忆,(2)检视影响记忆的关键因素,包括解码策略、前缀长度和FL算法。我们的发现表明,FL模型确实会记忆客户端数据,特别是内客户端数据,其记忆程度高于跨客户端数据,记忆受训练和推理因素的影响。

关键词

引用

@article{arxiv.2510.08750,
  title  = {Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning},
  author = {Tinnakit Udsa and Can Udomcharoenchaikit and Patomporn Payoungkhamdee and Sarana Nutanong and Norrathep Rattanavipanon},
  journal= {arXiv preprint arXiv:2510.08750},
  year   = {2026}
}

备注

Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)