中文

增强低资源语言的神经机器翻译:语料库开发、人工评估与可解释AI架构

计算与语言 2024-03-05 v1 人工智能

摘要

在当前机器翻译(MT)领域,Transformer架构是黄金标准,尤其适用于高资源语言对。本研究深入探讨了其在低资源语言对(包括英语↔爱尔兰语和英语↔马拉地语)上的有效性。值得注意的是,本研究确定了最佳超参数和子词模型类型,以显著提高Transformer模型在低资源语言对上的翻译质量。低资源语言平行数据集的稀缺会阻碍MT发展。为解决这一问题,我们开发了gaHealth,这是首个爱尔兰语健康数据双语语料库。聚焦健康领域,使用该领域内数据集开发的模型在BLEU分数上比LoResMT2021共享任务中的模型有非常显著的提升。随后使用多维质量指标错误分类法进行的人工评估表明,与基于RNN的对应系统相比,Transformer系统在减少准确性和流畅性错误方面表现更优。此外,本论文介绍了adaptNMT和adaptMLLM,这两个开源应用程序简化了神经机器翻译模型的开发、微调和部署。这些工具大大简化了设置和评估过程,使MT对开发者和翻译人员都更加易用。值得注意的是,adaptNMT基于OpenNMT生态系统,通过强调模型开发的环境足迹,促进了生态友好的自然语言处理研究。与LoResMT2021共享任务的基线相比,adaptMLLM对MLLM的微调在英语↔爱尔兰语和英语↔马拉地语这两个低资源语言对的翻译性能上取得了进步。

关键词

引用

@article{arxiv.2403.01580,
  title  = {Enhancing Neural Machine Translation of Low-Resource Languages: Corpus Development, Human Evaluation and Explainable AI Architectures},
  author = {Séamus Lankford},
  journal= {arXiv preprint arXiv:2403.01580},
  year   = {2024}
}

备注

PhD thesis