中文

一种从流行数据集中移除错误翻译以用于印度语言机器翻译任务的方法

计算与语言 2024-01-15 v1

摘要

利用计算机系统将内容从一种语言转换为另一种语言被称为机器翻译(MT)。为了确保保留源语言的上下文和词汇解释的有效翻译,已经出现了各种技术。端到端神经机器翻译(NMT)是一种流行的技术,现在广泛应用于实际的MT系统中。MT系统需要大量的平行数据集(一种语言的句子及其在另一种语言中的翻译)。这些数据集对于MT系统在训练阶段学习两种语言的语言结构和模式至关重要。其中一个数据集是Samanantar,它是印度语言(ILs)最大的公开可访问平行数据集。由于该语料库来自多个来源,因此包含许多不正确的翻译。因此,使用该数据集构建的MT系统无法发挥其通常的潜力。在本文中,我们提出了一种算法,用于从训练语料库中移除错误翻译,并评估其性能和效率。实验选择了两种印度语言(ILs),即印地语(HIN)和奥里亚语(ODI)。为这两种ILs构建了一个基线NMT系统,并研究了不同数据集大小的影响。实验中的翻译质量使用标准指标如BLEU、METEOR和RIBES进行评估。从结果中观察到,从数据集中移除不正确的翻译可以提高翻译质量。还注意到,尽管ILs-英语和英语-ILs系统使用相同的语料库进行训练,但ILs-英语在所有评估指标上表现更有效。

关键词

引用

@article{arxiv.2401.06398,
  title  = {An approach for mistranslation removal from popular dataset for Indic MT Task},
  author = {Sudhansu Bala Das and Leo Raphael Rodrigues and Tapas Kumar Mishra and Bidyut Kr. Patra},
  journal= {arXiv preprint arXiv:2401.06398},
  year   = {2024}
}

备注

18 pages