中文

超越 MLE:针对低资源神经机器翻译的 SEARNN 研究

计算与语言 2024-05-21 v1 机器学习

摘要

结构化预测任务,如机器翻译,涉及学习将结构化输入映射到结构化输出的函数。循环神经网络(RNN)历来是此类任务的热门选择,包括在自然语言处理(NLP)应用中。然而,使用最大似然估计(MLE)训练RNN存在局限性,包括暴露偏差(exposure bias)以及训练与测试指标之间的不匹配。基于学习搜索(L2S)框架,SEARNN 作为一种替代MLE的训练方法已被提出。本项目探讨了SEARNN在提升低资源非洲语言机器翻译方面的潜力——这是一项具有数据稀缺性和语言形态复杂性挑战的任务。通过在英译 Igbo、法译 Ewe、法译 Ghomala 三种语言方向上进行实验,本项目评估了SEARNN在应对这些语言特有的挑战方面相对于MLE目标的有效性。实验结果表明,SEARNN在BLEU分数上平均提升了5.4%,证明了SEARNN确实是一种有效的算法,可在低资源语言上高效训练RNN进行机器翻译。

关键词

引用

@article{arxiv.2405.11819,
  title  = {Beyond MLE: Investigating SEARNN for Low-Resourced Neural Machine Translation},
  author = {Chris Emezue},
  journal= {arXiv preprint arXiv:2405.11819},
  year   = {2024}
}

备注

In fulfillment of the 2024 practical coursework of IFT6132 course: https://www-labs.iro.umontreal.ca/~slacoste/teaching/ift6132/W24/