中文

联邦Word2Vec:利用联邦学习促进协作式表示学习

计算与语言 2021-05-04 v1 分布式、并行与集群计算 机器学习

摘要

大规模上下文表示模型近年来显著推进了NLP,前所未有地理解了文本语义。然而,它们需要处理大量数据以获得高质量结果。由于隐私与监管原因,从多源 join 并访问所有这些数据极具挑战。联邦学习可通过分布式训练模型、利用生成数据的设备硬件来克服这些限制。我们展示了以联邦学习协议训练NLP模型(具体为Word2Vec)的可行性。我们特别关注少量机构各持相对大规模语料的场景。结果表明,与集中式Word2Vec相比,联邦Word2Vec的结果质量与收敛时间均未退化。

关键词

引用

@article{arxiv.2105.00831,
  title  = {Federated Word2Vec: Leveraging Federated Learning to Encourage Collaborative Representation Learning},
  author = {Daniel Garcia Bernal and Lodovico Giaretta and Sarunas Girdzijauskas and Magnus Sahlgren},
  journal= {arXiv preprint arXiv:2105.00831},
  year   = {2021}
}