吉兹语的机器翻译
计算与语言
2024-04-16 v3
摘要
对于吉兹语等低资源语言的机器翻译(MT),吉兹语是一种不再作为任何社群母语的古老语言,面临着未登录词、领域不匹配以及缺乏充足标注训练数据等挑战。本工作中,我们探索了多种改进吉兹语机器翻译的方法,包括从相关语言进行迁移学习、优化共享词表与分词方法、微调大型预训练模型,以及使用大型语言模型(LLMs)结合模糊匹配的少样本翻译。我们基于语言亲缘关系开发了一个多语言神经机器翻译(MNMT)模型,相较于标准双语模型带来了约4 BLEU的平均性能提升。我们也尝试微调当今最先进的翻译模型之一NLLB-200,但发现其仅用4k吉兹语训练样本时表现不佳。此外,我们实验使用最先进的LLM——GPT-3.5,进行基于模糊匹配的少样本翻译,该方法利用基于嵌入相似度的检索从平行语料中查找上下文示例。我们观察到GPT-3.5在初始无吉兹语知识的情况下取得了9.2的显著BLEU分数,但仍低于15.2的MNMT基线。我们的工作为低资源及古老语言机器翻译不同方法的潜力与局限提供了见解。
引用
@article{arxiv.2311.14530,
title = {Machine Translation for Ge'ez Language},
author = {Aman Kassahun Wassie},
journal= {arXiv preprint arXiv:2311.14530},
year = {2024}
}
备注
8 pages, 1 figure