面向文档级机器翻译的目标端增强方法
计算与语言
2023-06-06 v2
摘要
文档级机器翻译由于其较长的输入长度和较少的训练数据而面临数据稀疏的挑战,增加了学习虚假模式的风险。为应对这一挑战,我们提出一种目标端增强方法,引入一个数据增强(DA)模型为每个源文档生成许多潜在翻译。在这些更广泛范围的翻译上学习,一个 MT 模型可以学习一个平滑的分布,从而降低数据稀疏的风险。我们证明,该估计后验分布的 DA 模型大幅提升了 MT 性能,在 News 上比以前的最佳系统高出 2.30 s-BLEU,并在 News 和 Europarl 基准上取得新的最先进水平。我们的代码可在 https://github.com/baoguangsheng/target-side-augmentation 获取。
引用
@article{arxiv.2305.04505,
title = {Target-Side Augmentation for Document-Level Machine Translation},
author = {Guangsheng Bao and Zhiyang Teng and Yue Zhang},
journal= {arXiv preprint arXiv:2305.04505},
year = {2023}
}
备注
Accepted by ACL2023 main conference