阿姆哈拉语-阿拉伯语神经机器翻译
计算与语言
2020-01-01 v1 机器学习
摘要
许多自动翻译工作利用大规模平行语料库在主要欧洲语言对之间展开,但由于平行数据稀缺,针对阿姆哈拉语-阿拉伯语语言对的研究极少。我们使用基于注意力的编码器-解码器架构(改编自开源 OpenNMT 系统)开发了两种基于长短期记忆(LSTM)和门控循环单元(GRU)的神经机器翻译(NMT)模型。为进行实验,我们通过修改 Tanzile 上现有的单语阿拉伯语文本及其等效的阿姆哈拉语译本语料库,构建了一个小型平行《古兰经》文本语料库。将基于 LSTM 和 GRU 的 NMT 模型与谷歌翻译系统比较,发现基于 LSTM 的 OpenNMT 优于基于 GRU 的 OpenNMT 和谷歌翻译系统,其 BLEU 分数分别为 12%、11% 和 6%。
引用
@article{arxiv.1912.13161,
title = {Amharic-Arabic Neural Machine Translation},
author = {Ibrahim Gashaw and H L Shashirekha},
journal= {arXiv preprint arXiv:1912.13161},
year = {2020}
}
备注
15 pages