中文

面向神经机器翻译的通信高效联邦学习

计算与语言 2021-12-14 v1

摘要

在联邦学习(FL)设定下训练神经机器翻译(NMT)模型可能在计算与通信两方面均效率低下,这源于翻译引擎的庞大尺寸以及训练客户端与中央服务器所需的多轮更新。本文中,我们探究如何通过提出一种新颖方案来在FL设置中高效构建NMT模型。为降低通信开销,我们在所有神经层中仅交换我们所称的“Controller”层。Controllers是连接到我们预训练架构上的少量附加神经组件。这些新组件被置于原始层之间,充当与中央服务器通信并学习足以更新客户端的最小信息的联络者。我们在来自不同领域的五个数据集上评估了模型性能,以实现从德语到英语的翻译。我们注意到,配备Controllers的模型表现与在集中式非FL设定下训练的模型相当。此外,我们观察到FL流水线的通信流量大幅降低,这是使用Controllers的直接结果。基于我们的实验,基于Controller的模型比其他同类模型便宜约6倍。当我们考虑大型模型中的参数数量时,这种降低极为重要,而当此类参数需在FL设定下多轮交换时则变得更为关键。

关键词

引用

@article{arxiv.2112.06135,
  title  = {Communication-Efficient Federated Learning for Neural Machine Translation},
  author = {Tanya Roosta and Peyman Passban and Ankit Chadha},
  journal= {arXiv preprint arXiv:2112.06135},
  year   = {2021}
}

备注

The first two authors contributed equally