中文

缓解多语言机器翻译中的数据不平衡与表示退化

计算与语言 2023-10-26 v2

摘要

尽管多语言神经机器翻译(MNMT)取得了进展,我们认为该领域仍面临两大挑战:数据不平衡与表示退化。数据不平衡问题指所有语言对平行语料数量的不平衡,尤其是长尾语言(即极低资源语言)。表示退化问题指编码后的词元倾向于仅出现在 MNMT 模型可用全空间的一小部分子空间中。为解决这两类问题,我们提出 Bi-ACL 框架,仅使用目标端单语数据与双语词典来提升 MNMT 模型性能。我们定义双向自编码器与双向对比学习两个模块,并将其与在线约束束搜索及课程学习采样策略相结合。大量实验表明,我们所提方法在长尾语言与高资源语言上均更为有效。我们还证明该方法能够在零样本场景下实现跨领域与跨语言的知识迁移。

关键词

引用

@article{arxiv.2305.12786,
  title  = {Mitigating Data Imbalance and Representation Degeneration in Multilingual Machine Translation},
  author = {Wen Lai and Alexandra Chronopoulou and Alexander Fraser},
  journal= {arXiv preprint arXiv:2305.12786},
  year   = {2023}
}

备注

Accepted to Findings of EMNLP 2023, add statistical significance tests. code available at https://github.com/lavine-lmu/Bi-ACL