中文

面向现代标准阿拉伯语-埃及语代码混合至英语机器翻译的探究

机器学习 2021-05-31 v1 计算与语言

摘要

神经机器翻译(NMT)近期的进展使得在存在大规模平行数据的单语语言对间成功翻译成为可能,而预训练模型进一步提升了性能。尽管已有关于代码混合环境(其中一对文本包含两种或更多语言)中翻译的工作,但 NMT 与语言建模的近期成功对代码混合文本翻译究竟意味着什么仍不明确。我们探究了这样一种情境,即代码混合的现代标准阿拉伯语与埃及阿拉伯语(MSAEA)到英语的机器翻译(MT)。我们在不同条件下开发模型,采用(i)从头训练的标准端到端序列到序列(S2S) Transformer,以及(ii)预训练的 S2S 语言模型(LM)。仅使用 MSA-EN 平行数据与从头训练的 S2S 模型,我们便获得了合理性能。我们还发现,在多种阿拉伯方言数据上微调的 LM 有助于 MSAEA-EN 任务。我们的工作处于代码切换机器翻译共享任务背景下。我们的最佳模型取得了 25.72\bf25.72 BLEU,在官方 MSAEA-EN 共享任务评测中排名第一。

关键词

引用

@article{arxiv.2105.13573,
  title  = {Investigating Code-Mixed Modern Standard Arabic-Egyptian to English Machine Translation},
  author = {El Moatez Billah Nagoudi and AbdelRahim Elmadany and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2105.13573},
  year   = {2021}
}

备注

CALCS2021, colocated with NAACL-2021