中文

学习跨语言音系与正字法适配:以改进低资源语言间神经机器翻译为例

计算与语言 2021-04-21 v2

摘要

未登录词(OOV)会给机器翻译(MT)任务带来严峻挑战,尤其对于低资源语言(LRL)对,即几乎不存在平行语料库的语言对。我们的工作调整了 seq2seq 模型的变体,以执行此类词从印地语到博杰普尔语(一个 LRL 实例)的转导,从印地语—博杰普尔语双语词典构建的一组同源词对中学习。我们证明了我们的模型可有效用于具有有限平行语料库的语言对;我们的模型在字符级运作,以掌握跨多种词适配类型(无论是共时还是历时、借词或同源词)的语音与正字法相似性。我们描述了我们调整用于该任务的若干字符级 NMT 系统的训练方面,并刻画了它们的典型错误。我们的方法在印地语到博杰普尔语翻译任务上将 BLEU 分数提高了 6.3。此外,我们表明此类转导可很好地泛化至其它语言,通过将其成功应用于印地语—孟加拉语同源词对。我们的工作可视为以下过程的重要一步:(i) 解决 MT 任务中出现的 OOV 词问题,(ii) 为资源受限语言创建有效平行语料库,以及 (iii) 利用词级嵌入所增强的语义知识来执行字符级任务。

关键词

引用

@article{arxiv.1811.08816,
  title  = {Learning cross-lingual phonological and orthagraphic adaptations: a case study in improving neural machine translation between low-resource languages},
  author = {Saurav Jha and Akhilesh Sudhakar and Anil Kumar Singh},
  journal= {arXiv preprint arXiv:1811.08816},
  year   = {2021}
}

备注

47 pages, 4 figures, 21 tables (including Appendices)