通过通才与专家混合实现设备端协同语言建模
机器学习
2025-05-30 v4 计算与语言
摘要
设备端 LLMs 因其能够增强隐私并提供个性化用户体验而受到越来越多的关注。为在数据稀缺的情况下实现隐私学习,联邦学习已成为一种标准方法。然而,它面临着终端用户之间的计算资源异构性和数据异构性等挑战。我们提出 CoMiGS(llaborative learning with a xture of eneralists and pecialists,通才与专家混合的协同学习),这是首个同时解决上述两项挑战的方法。我们方法的一项关键创新是 Mixture-of-Experts 学习目标的双层优化建模,其中路由器使用独立的验证集进行优化,以确保与目标分布对齐。我们采用交替最小化来求解该目标,并提供了理论分析。该方法在用户间共享通才专家,同时本地化不同数量的专家专家,从而适应用户的计算资源并保护隐私。通过大量实验,我们表明 CoMiGS 能够在每次 token 生成时有效平衡通用知识与个性化知识。我们证明,得益于通才的正则化效应,CoMiGS 在通过专家知识适应本地数据的同时,对过拟合保持鲁棒。我们开源了协同 LLMs 的代码库。
引用
@article{arxiv.2409.13931,
title = {On-Device Collaborative Language Modeling via a Mixture of Generalists and Specialists},
author = {Dongyang Fan and Bettina Messmer and Nikita Doikov and Martin Jaggi},
journal= {arXiv preprint arXiv:2409.13931},
year = {2025}
}
备注
Camera-ready version