中文

领域适应机器翻译:灾难性遗忘忘记了什么以及为何如此?

计算与语言 2024-12-24 v1

摘要

神经机器翻译(NMT)模型可以通过领域适应进行专业化,通常涉及针对特定数据集进行微调。这一过程可能导致灾难性遗忘:即通用翻译质量的快速下降。灾难性遗忘已被广泛观察到,许多缓解方法也被提出。然而,遗忘的原因以及遗忘与适应数据之间的关系仍未充分探讨。本文以全新方式理解 NMT 适应期间的灾难性遗忘,通过考察数据对其影响。我们提供了对“遗忘了什么”以及“为何如此”的首次探索。我们检讨了遗忘与 in-domain 数据之间的关系,表明遗忘的数量及类型与该数据的目标词汇覆盖率相关。我们的发现为更有针对性地进行 NMT 领域适应铺平了道路。

关键词

引用

@article{arxiv.2412.17537,
  title  = {Domain adapted machine translation: What does catastrophic forgetting forget and why?},
  author = {Danielle Saunders and Steve DeNeefe},
  journal= {arXiv preprint arXiv:2412.17537},
  year   = {2024}
}

备注

EMNLP 2024