中文

Mergen:基于增强数据训练的首个满韩机器翻译模型

计算与语言 2024-01-15 v2

摘要

满语根植于中国东北的历史满洲地区,由于仅存极少使用者,目前面临严峻的灭绝威胁。为保护满语,我们推出 Mergen,这是首个满韩机器翻译(MT)模型的尝试。为开发该模型,我们利用了《满文老档》(一部历史典籍)与满韩词典等宝贵资源。由于满韩平行数据集稀缺,我们通过采用基于 GloVe 词嵌入(在单语与平行文本上训练)的词替换来扩充数据。我们的方法围绕编码器-解码器神经机器翻译模型构建,并融合了双向门控循环单元(GRU)层。实验取得了可喜结果,显示出满韩翻译的显著提升,BLEU 分数提高了 20-30 分。

关键词

引用

@article{arxiv.2311.17492,
  title  = {Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data},
  author = {Jean Seo and Sungjoo Byun and Minha Kang and Sangah Lee},
  journal= {arXiv preprint arXiv:2311.17492},
  year   = {2024}
}

备注

emnlp2023/mrl2023