通过基于群体的差异最小化实现无监督多源联邦域适应的扩展
计算与语言
2025-10-10 v1 人工智能
机器学习
摘要
无监督多源域适应(UMDA)利用来自多个源域的标记数据以泛化到未标记的目标域。虽然联邦UMDA通过避免原始数据共享来解决隐私问题,但现有方法随着源数量的增加效果不佳,常 suffer from high computational overhead 或 training instability。我们提出GALA框架,一个可扩展且稳健的联邦UMDA框架,旨在处理高多样性场景。GALA通过耦合一种新的基于群体的差异最小化目标函数,该目标函数以线性复杂度近似成对对齐,以及一种受温度控制的基于簇的加权策略,用于动态源优先级排序。这些组件使跨众多异构源的训练实现稳定、可并行化,从而解决当前文献中 largely unaddressed 的关键可扩展性瓶颈。为评估高多样性场景下的性能,我们引入Digit-18,一个新基准,包含18个数据集,涵盖各种合成和真实世界的域迁移。广泛的实验表明,GALA在标准基准上实现了最先进的结果,在大规模设置中显著优于先前方法,而其他方法要么无法收敛,要么在计算上不可行。
引用
@article{arxiv.2510.08149,
title = {AI Knowledge Assist: An Automated Approach for the Creation of Knowledge Bases for Conversational AI Agents},
author = {Md Tahmid Rahman Laskar and Julien Bouvier Tremblay and Xue-Yong Fu and Cheng Chen and Shashi Bhushan TN},
journal= {arXiv preprint arXiv:2510.08149},
year = {2025}
}
备注
Accepted to the EMNLP 2025 Industry Track