通过韩语(南)学习翻译朝鲜语(北)
计算与语言
2022-01-28 v1
摘要
韩国南北双方均使用韩语。然而,韩语 NLP 研究仅聚焦于韩国(南),现有韩语 NLP 系统(如神经机器翻译(NMT)模型)无法妥善处理朝鲜语(北)输入。使用朝鲜语数据训练模型是解决此问题最直接的途径,但用于训练 NMT 模型的数据不足。本研究利用可比语料库为朝鲜语 NMT 模型创建数据。首先,我们手动创建用于自动对齐与机器翻译的评测数据。随后,探究适用于朝鲜语(北)的自动对齐方法。最后,我们验证:在零样本设定下,由无人工标注的朝鲜语双语数据训练的模型,相较现有韩国语(南)模型能显著提升朝鲜语翻译准确率。
引用
@article{arxiv.2201.11258,
title = {Learning How to Translate North Korean through South Korean},
author = {Hwichan Kim and Sangwhan Moon and Naoaki Okazaki and Mamoru Komachi},
journal= {arXiv preprint arXiv:2201.11258},
year = {2022}
}
备注
8 pages, 1 figures, 8 tables