利用线性注意力建模上下文以实现可扩展的文档级翻译
计算与语言
2022-10-18 v1
摘要
文档级机器翻译利用句间依赖关系来生成更连贯、一致的译文。然而,这些模型主要基于 Transformer,由于其注意力层在序列长度上具有二次复杂度,难以扩展到长文档。近期关于高效注意力的研究提升了可扩展性,但其在文档翻译上的效果尚待探索。在本工作中,我们研究了 Peng 等人(2021)提出的近期线性注意力模型在文档翻译上的有效性,并为其增加句子门控以促进近因归纳偏置。我们在 IWSLT 2015 和 OpenSubtitles 2018 上针对 Transformer 对该模型进行了评估,结果表明在长序列上解码速度大幅提升,且 BLEU 分数相当或更好。我们展示了句子门控在 IWSLT 上进一步提升了翻译质量。
引用
@article{arxiv.2210.08431,
title = {Modeling Context With Linear Attention for Scalable Document-Level Translation},
author = {Zhaofeng Wu and Hao Peng and Nikolaos Pappas and Noah A. Smith},
journal= {arXiv preprint arXiv:2210.08431},
year = {2022}
}
备注
Findings of EMNLP 2022