应用于低资源机器翻译的文本增强技术:以斯瓦希里语为例
计算与语言
2023-06-14 v1
摘要
在这项工作中,我们研究了将文本数据增强任务应用于低资源机器翻译的影响。近期,针对有限资源语言训练系统的研究方法引起了关注,其中一种流行方法是使用数据增强技术。数据增强旨在增加可用于训练系统的数据量。在机器翻译中,世界上大多数语言对被认为是低资源的,因为它们可用的平行数据很少,且神经机器翻译(NMT)系统的质量在很大程度上依赖于大规模平行语料库的可获得性。我们研究并应用了三种在文本分类任务中常用的简单数据增强技术:同义词替换、随机插入和上下文数据增强,并将其性能与英语-斯瓦希里语(En-Sw)数据集的基线神经机器翻译进行比较。我们还给出了 BLEU、ChrF 和 Meteor 分数的结果。总体而言,上下文数据增强技术在 和 两个方向上均显示出一定提升。我们认为,若使用多样化数据集进行更充分的实验,这些方法在神经机器翻译中具有应用潜力。
引用
@article{arxiv.2306.07414,
title = {Textual Augmentation Techniques Applied to Low Resource Machine Translation: Case of Swahili},
author = {Catherine Gitau and VUkosi Marivate},
journal= {arXiv preprint arXiv:2306.07414},
year = {2023}
}
备注
Accepted for Third workshop on Resources for African Indigenous Languages (RAIL)