翻译未见之物?低资源、形态无标记设定下的约鲁巴语-英语机器翻译
计算与语言
2021-04-07 v3 人工智能
机器学习
摘要
在某一语言中以形态标记某些特征、而在另一语言中这些特征缺失或仅以语境标记的语言间进行翻译,是机器翻译的重要测试用例。当从使用光秃名词但语境标记这些特征的约鲁巴语(Yorùbá)翻译到在形态上标记(非)定指性的英语时,会产生歧义。本文中,我们对 SMT 系统与两个 NMT 系统(BiLSTM 与 Transformer)在翻译约鲁巴语光秃名词为英语时的表现进行了细粒度分析。我们考察这些系统在何种程度上识别光秃名词、正确翻译它们,并与人类翻译模式比较。我们还分析了各模型所犯错误的类型,并给出了这些错误的语言学描述。我们为低资源设定下的模型性能评估获得见解。在翻译光秃名词时,我们的结果显示 transformer 模型在 4 类上优于 SMT 与 BiLSTM 模型,BiLSTM 在 3 类上优于 SMT 模型,而 SMT 在 1 类上优于 NMT 模型。
引用
@article{arxiv.2103.04225,
title = {Translating the Unseen? Yoruba-English MT in Low-Resource, Morphologically-Unmarked Settings},
author = {Ife Adebara and Muhammad Abdul-Mageed and Miikka Silfverberg},
journal= {arXiv preprint arXiv:2103.04225},
year = {2021}
}
备注
Accepted at AfricanNLP @ EACL 2021