FedMatch:面向异构问答数据的联邦学习
信息检索
2021-09-07 v2
摘要
问答(QA)作为一种流行且有前景的智能信息获取技术,与多数其他AI技术一样面临数据困境。一方面,现代QA方法依赖通常为数据饥渴的深度学习模型,因此期望将可用QA数据集收集并融合于同一站点以开发强大QA模型。另一方面,现实世界QA数据集通常以属于不同方的孤立岛形式分布。由于隐私安全意识的增强,整合分散数据几乎不可能或成本 prohibitive。该困境的一种可能解法是称为联邦学习的新方法,一种面向分布式数据集的隐私保护机器学习技术。本工作中,我们提出将联邦学习用于QA,并特别关注QA数据的统计异构性。此处异构性指标注QA数据在实践中通常具有非独立同分布(non-IID)与规模不平衡。传统联邦学习方法在异构情形下可能牺牲个体模型精度。为解决此问题,我们提出一种用于QA的新型联邦匹配框架,名为FedMatch,采用骨干-补丁架构。共享骨干用于提炼所有参与方的公共知识,而私有补丁为紧凑高效模块以保留各参与方的领域信息。为便于评估,我们基于来自不同领域的若干QA数据集构建基准集合以模拟实践中的异构情形。实证研究表明,我们的模型在所有数据集上相较基线均取得显著改进。
引用
@article{arxiv.2108.05069,
title = {FedMatch: Federated Learning Over Heterogeneous Question Answering Data},
author = {Jiangui Chen and Ruqing Zhang and Jiafeng Guo and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2108.05069},
year = {2021}
}
备注
Accepted by CIKM 2021