一种用于低资源语言对的增强翻译技术:梵语到印地语翻译
计算与语言
2020-06-16 v1
摘要
神经机器翻译(NMT)是一种利用庞大人工神经网络进行机器翻译(MT)的 ongoing 技术。它已展现出有前景的结果,并在解决具有挑战性的机器翻译任务中显示出巨大潜力。其中一项任务是如何为仅有少量训练数据的语言对提供良好的MT。在这项工作中,针对低资源语言对考察了零样本翻译(ZST)。通过在有基准可用的高资源语言对(即西班牙语到葡萄牙语)上工作,并训练于数据集(西班牙语-英语和英语-葡萄牙语),我们准备了一个ZST系统的概念验证,其在可用数据上给出适当结果。随后,将相同架构用于数据稀疏的梵语到印地语翻译测试,通过在英语-印地语和梵语-英语语言对上训练模型。为了用ZST系统准备和翻译,我们扩展了tensorflow中NMT seq2seq模型的训练和推理流水线,集成了ZST特性。对词嵌入进行降维以减少数据存储的内存占用,并实现更快的训练和翻译周期。在这项工作中,以创新方式利用现有有用技术来执行我们的梵语到印地语翻译NLP问题。构建了300条的梵语-印地语平行语料库用于测试。构建平行语料库所需数据取自印度中央邦邦政府公共信息部网站上发布的新闻广播。
引用
@article{arxiv.2006.08332,
title = {An Augmented Translation Technique for low Resource language pair: Sanskrit to Hindi translation},
author = {Rashi Kumar and Piyush Jha and Vineet Sahula},
journal= {arXiv preprint arXiv:2006.08332},
year = {2020}
}