面向匈牙利语-英语的神经机器翻译模型开发
计算与语言
2021-11-09 v1 机器学习
摘要
我使用 Hunglish2 语料库,针对英语-匈牙利语和匈牙利语-英语的神经机器翻译任务训练模型。本工作的主要贡献在于评估 NMT 模型训练过程中的不同数据增强方法。我提出了 5 种结构感知的增强方法,即不随机选取词进行遮盖或替换,而是以句子的依存树作为增强的基础。我的论文以对神经网络、序列建模、神经机器翻译、依存句法分析和数据增强的详细文献综述开头。在对 Hunglish2 语料库进行详细探索性数据分析与预处理后,我使用所提出的数据增强技术进行了实验。匈牙利语-英语的最佳模型取得了 33.9 的 BLEU 分数,而英语-匈牙利语的最佳模型取得了 28.6 的 BLEU 分数。
引用
@article{arxiv.2111.04099,
title = {Developing neural machine translation models for Hungarian-English},
author = {Attila Nagy},
journal= {arXiv preprint arXiv:2111.04099},
year = {2021}
}