P-Transformer:面向更优的文档到文档神经机器翻译
计算与语言
2022-12-13 v1
摘要
直接从头通过 Transformer 训练文档到文档(Doc2Doc)神经机器翻译(NMT)尤其是在小数据集上通常无法收敛。我们专门的探测任务表明:1)绝对位置信息和相对位置信息一旦到达上层编码器层就会逐渐减弱甚至消失;2)编码器输出中绝对位置信息的消失导致了 Doc2Doc NMT 的训练失败。为缓解该问题,我们提出位置感知 Transformer(P-Transformer)以增强自注意力和交叉注意力中绝对与相对位置信息。具体而言,我们通过简单而有效的加法操作将绝对位置信息(即位置嵌入)整合到自注意力和交叉注意力中的查询-键对中。此外,我们还在自注意力中整合了相对位置编码。所提出的 P-Transformer 采用正弦位置编码,不需要任何任务指定的位置嵌入、段落嵌入或注意力机制。通过上述方法,我们构建了带有 P-Transformer 的 Doc2Doc NMT 模型,该模型以序列到序列(seq2seq)方式接收源文档并完整生成目标文档。此外,P-Transformer 可应用于基于 seq2seq 的文档到句子(Doc2Sent)和句子到句子(Sent2Sent)翻译。Doc2Doc NMT 的大量实验结果表明,P-Transformer 在 7 个语言对、涵盖小、中、大规模广泛使用的 9 个文档级数据集上显著优于强基线,并达到了新的 SOTA。关于语篇现象的实验表明,我们的 Doc2Doc NMT 模型在 BLEU 和语篇连贯性上均提升了翻译质量。我们在 Github 上公开了代码。
引用
@article{arxiv.2212.05830,
title = {P-Transformer: Towards Better Document-to-Document Neural Machine Translation},
author = {Yachao Li and Junhui Li and Jing Jiang and Shimin Tao and Hao Yang and Min Zhang},
journal= {arXiv preprint arXiv:2212.05830},
year = {2022}
}
备注
Submitted to TASLP