中文

用于文档级神经机器翻译的重要性感知数据增强

计算与语言 2024-01-30 v1

摘要

文档级神经机器翻译(DocNMT)旨在生成连贯且具有凝聚力的译文,这与句子级翻译形成对比。然而,由于其输入长度较长且训练数据有限,DocNMT 经常面临数据稀疏的挑战。为了克服这一问题,我们提出了一种用于 DocNMT 的新型重要性感知数据增强(IADA)算法,该算法基于由隐藏状态范数和训练梯度估计的 token 重要性信息来增强训练数据。我们在三个广泛使用的 DocNMT 基准上进行了全面实验。我们的实证结果表明,我们提出的 IADA 优于强大的 DocNMT 基线以及几种数据增强方法,并在句子级和文档级 BLEU 上具有统计显著性。

关键词

引用

@article{arxiv.2401.15360,
  title  = {Importance-Aware Data Augmentation for Document-Level Neural Machine Translation},
  author = {Minghao Wu and Yufei Wang and George Foster and Lizhen Qu and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2401.15360},
  year   = {2024}
}

备注

13 pages, 4 figures, 7 tables, accepted by EACL2024 main conference