中文

用于神经机器翻译的确定性可逆数据增强

计算与语言 2025-02-21 v2

摘要

数据增强是机器翻译中多样化语料库的有效方法,但先前的方法可能由于不可逆操作和随机子词采样过程而引入原始数据与增强数据之间的语义不一致。为了生成既符号多样化又语义一致的增强数据,我们提出了确定性可逆数据增强(DRDA),一种简单但有效的神经机器翻译数据增强方法。DRDA采用确定性分割和可逆操作来生成多粒度子词表示,并通过多视图技术将它们拉近。无需额外的语料库或模型更改,DRDA在多个翻译任务上以明显优势(相比Transformer最高提升4.3 BLEU)超越了强基线,并在噪声、低资源和跨领域数据集中表现出良好的鲁棒性。

关键词

引用

@article{arxiv.2406.02517,
  title  = {Deterministic Reversible Data Augmentation for Neural Machine Translation},
  author = {Jiashu Yao and Heyan Huang and Zeming Liu and Yuhang Guo},
  journal= {arXiv preprint arXiv:2406.02517},
  year   = {2025}
}

备注

Findings of ACL 2024