中文

面向印度语言间互译的多语言神经机器翻译系统

计算与语言 2023-06-23 v1

摘要

本文给出在Samanantar语料上实现并基于Flores-200语料分析的、面向11种印度语言(IL)的印度语到印度语(IL-IL)多语言神经机器翻译(MNMT)基线模型。所有模型均使用BLEU分数评估。此外,这些语言被归为三类:东印度-雅利安语(EI)、达罗毗荼语(DR)和西印度-雅利安语(WI)。研究了语言亲缘关系对MNMT模型效率的影响。鉴于存在大量英语(EN)到IL的语料,我们也构建并考察了以EN为枢纽的MNMT IL-IL模型。为此,我们还开发了英语-印度语(EN-IL)模型,包含使用与不使用的亲缘语言两种情况。结果显示,使用亲缘语言仅对WI组有益,对EI组有害,对DR组影响不确定,但对EN-IL模型有用。因此,利用亲缘语言组开发枢纽MNMT模型。进而,将IL语料从相应文字转写为改进的ITRANS文字,并基于转写语料构建前述方法中最佳的MNMT模型。观察到枢纽模型大幅改进MNMT基线,其中AS-TA的BLEU最低,PA-HI最高。各语言中,AS、ML和TA的BLEU最低,而HI、PA和GU表现最佳。转写除少数例外亦有助于模型。所有语言中,ML、TA和BN的分数提升最大,KN、HI和PA的平均提升最小。所获得的最佳模型为在PAWI转写语料上训练的PA-HI语言对,其BLEU为24.29。

关键词

引用

@article{arxiv.2306.12693,
  title  = {Multilingual Neural Machine Translation System for Indic to Indic Languages},
  author = {Sudhansu Bala Das and Divyajyoti Panda and Tapas Kumar Mishra and Bidyut Kr. Patra and Asif Ekbal},
  journal= {arXiv preprint arXiv:2306.12693},
  year   = {2023}
}

备注

38 pages, 2 figures