基于 Transformer 的英爱神经机器翻译的人工评估
计算与语言
2024-03-06 v1 人工智能
摘要
本研究对超参数设置如何影响低资源英语 - 爱尔兰语对的基于 Transformer 的神经机器翻译(NMT)质量进行了人工评估。评估了使用字节对编码(BPE)和 unigram 方法的 SentencePiece 模型。模型架构的变化包括修改层数、评估注意力机制的最佳头数以及测试各种正则化技术。性能提升最大的是采用 16k BPE 子词模型的 Transformer 优化模型。与基线循环神经网络(RNN)模型相比,Transformer 优化模型的 BLEU 分数提高了 7.8 分。与谷歌翻译进行基准测试时,我们的翻译引擎显示出显著改进。此外,还进行了一项定量的细粒度人工评估,比较了机器翻译系统的性能。利用多维质量指标(MQM)错误分类法,探讨了基于 RNN 的系统与基于 Transformer 的系统所产生的错误类型的人工评估结果。我们的研究结果表明,与基于 RNN 的模型相比,表现最佳的 Transformer 系统显著减少了准确性和流畅性错误。
引用
@article{arxiv.2403.02366,
title = {Human Evaluation of English--Irish Transformer-Based NMT},
author = {Séamus Lankford and Haithem Afli and Andy Way},
journal= {arXiv preprint arXiv:2403.02366},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2403.01985