面向增强型语言模型联邦学习的隐私保护数据去重(扩展版)
密码学与安全
2024-12-05 v2 人工智能
计算与语言
机器学习
摘要
去重是提升机器学习模型性能、节省训练时间和能源消耗的关键预处理步骤。然而,由于可扩展性问题以及如果去重涉及共享所有客户端数据可能导致隐私泄露的挑战,通过联邦学习实现去重一直备受关注。本文通过引入高效隐私保护多方去重协议(EP-MPD)来解决联邦环境下的去重问题。该协议能够在不损害数据隐私的前提下高效地来自多个客户端数据集中移除重复项。EP-MPD以模块化方式构建,利用两种新的私有集合交集协议变体。我们的大量实验表明,去重在大型语言模型的联邦学习中具有显著的益处。例如,我们观察到在重复率在10%至30%之间时,困惑度提升最高可达19.62%,运行时间缩短最高可达27.95%。EP-MPD在联邦学习中有效地平衡了隐私与性能,为大规模应用提供了有价值的解决方案。
引用
@article{arxiv.2407.08152,
title = {Privacy-Preserving Data Deduplication for Enhancing Federated Learning of Language Models (Extended Version)},
author = {Aydin Abadi and Vishnu Asutosh Dasu and Sumanta Sarkar},
journal= {arXiv preprint arXiv:2407.08152},
year = {2024}
}
备注
Accepted at the Network and Distributed Systems Security (NDSS) Symposium, 2025