中文

构建宿务语-菲律宾语神经机器翻译系统的语言资源

计算与语言 2021-11-01 v1

摘要

平行语料库是基于机器学习的翻译中的关键资源。为构建可用于翻译的合格语料库而进行的文本收集、抽取与对齐任务非常繁琐,对于低资源语言尤其如此。在本文中,我们介绍了从两个不同领域(圣经文本与网络)构建宿务语和菲律宾语平行语料库的努力。对于圣经资源,应用动词的子词单元翻译和名词的可复制方法来纠正翻译中的不一致性。该纠正机制被用作一种预处理技术。另一方面,对于作为主流网络资源的维基百科,从源语言和目标语言中抽取了常见出现的话题片段。这些被观察到的话题片段在 4 个不同类别中是独特的。这些话题片段的识别可用于句子的自动抽取。使用循环神经网络(Recurrent Neural Network)在 TensorFlow 中借助 OpenNMT 序列建模工具实现翻译。随后将这两份不同的语料库作为神经网络中的两个独立输入进行评估。结果显示两份语料库的 BLEU 分数存在差异。

关键词

引用

@article{arxiv.2110.15716,
  title  = {Building the Language Resource for a Cebuano-Filipino Neural Machine Translation System},
  author = {Kristine Mae Adlaon and Nelson Marcos},
  journal= {arXiv preprint arXiv:2110.15716},
  year   = {2021}
}

备注

Published in the Proceedings of the 2019 3rd International Conference on Natural Language Processing and Information Retrieval. arXiv admin note: substantial text overlap with arXiv:1902.07250