低资源英语-提格里尼亚语机器翻译:利用多语言模型、自定义分词器与干净的评估基准
计算与语言
2025-09-25 v1 人工智能
摘要
尽管神经机器翻译 (NMT) 取得了进展,但像提格里尼亚语这样的低资源语言仍因有限的语料库、不充分的分词策略以及缺乏标准化的评估基准而得不到充分服务。本文研究了利用多语言预训练模型进行迁移学习以提升形态丰富的低资源语言翻译质量的技术。我们提出了一种融合语言特定分词、基于信息的嵌入初始化和领域自适应微调的精炼方法。为实现严格的评估,我们构建了一个高质量的、人工对齐的英语-提格里尼亚语评估数据集,涵盖多个领域。实验结果表明,采用自定义分词器的迁移学习显著优于零样本基线,其增益通过 BLEU、chrF 和定性人工评估得到验证。Bonferroni 校正应用于确保各配置间的统计显著性。错误分析揭示了关键局限性并指导了有针对性的改进。本研究强调了语言感知建模和可复现基准在弥合代表性不足语言性能差距方面的重要性。相关资源可在 https://github.com/hailaykidu/MachineT_TigEng 和 https://huggingface.co/Hailay/MachineT_TigEng 获取。
引用
@article{arxiv.2509.20209,
title = {Low-Resource English-Tigrinya MT: Leveraging Multilingual Models, Custom Tokenizers, and Clean Evaluation Benchmarks},
author = {Hailay Kidu Teklehaymanot and Gebrearegawi Gidey and Wolfgang Nejdl},
journal= {arXiv preprint arXiv:2509.20209},
year = {2025}
}
备注
This submission is 8 pages long, includes 4 tables, and contains all required conference details