面向文档级机器翻译的G-Transformer
计算与语言
2021-06-01 v1 机器学习
摘要
文档级机器翻译模型仍远未令人满意。现有工作将翻译单元从单句扩展至多句。然而,研究表明,当我们将翻译单元进一步扩大到整个文档时,Transformer的监督训练会失败。本文中,我们发现此种失败并非由过拟合引起,而是训练过程中陷入局部极小值所致。我们的分析表明,目标到源注意力的复杂度增加是失败的一个原因。作为解决方案,我们提出G-Transformer,将局部性假设作为归纳偏置引入Transformer,从而缩减目标到源注意力的假设空间。实验表明,G-Transformer比Transformer收敛更快且更稳定,在三个基准数据集上于非预训练与预训练设定下均取得了新的SOTA BLEU分数。
引用
@article{arxiv.2105.14761,
title = {G-Transformer for Document-level Machine Translation},
author = {Guangsheng Bao and Yue Zhang and Zhiyang Teng and Boxing Chen and Weihua Luo},
journal= {arXiv preprint arXiv:2105.14761},
year = {2021}
}
备注
Accepted by ACL2021 main track