利用词性标注改进英到僧伽罗语神经机器翻译
计算与语言
2022-02-21 v1 机器学习
摘要
神经机器翻译(NMT)的性能在很大程度上取决于可用平行语料库的大小。鉴于此,低资源语言对的翻译性能相较于高资源语言对明显更低。当对形态丰富的语言进行 NMT 时,翻译质量进一步下降。尽管网络包含大量信息,但斯里兰卡大多数人无法正确阅读和理解英语。因此,亟需将英文内容翻译为当地语言以在本地人之间共享信息。僧伽罗语是斯里兰卡的主要语言,由于这两种语言在低资源约束下存在句法差异,构建能够生成高质量英到僧伽罗语翻译的 NMT 系统十分困难。因此,在本研究中,我们探索了将词性(POS)标注融入 Transformer 输入嵌入与位置编码的有效方法,以进一步提升基线英到僧伽罗语神经机器翻译模型的性能。
引用
@article{arxiv.2202.08882,
title = {Improving English to Sinhala Neural Machine Translation using Part-of-Speech Tag},
author = {Ravinga Perera and Thilakshi Fonseka and Rashmini Naranpanawa and Uthayasanker Thayasivam},
journal= {arXiv preprint arXiv:2202.08882},
year = {2022}
}