通过检索增强的LLM提示实现低资源机器翻译:以曼拜语为例的研究
计算与语言
2025-01-28 v1
摘要
本研究探索使用大语言模型(LLM)将英语翻译成曼拜语——一种在东帝汶约有20万母语者的低资源南岛语系语言。利用从曼拜语手册和新翻译的句子(由母语者翻译)构建的新颖语料库,我们检验了在此低资源环境下,少样本LLM提示用于机器翻译(MT)的效果。我们的方法涉及策略性地选择平行句和词典条目进行提示,旨在使用开源和专有LLM(LlaMa 2 70b、Mixtral 8x7B、GPT-4)提高翻译准确性。我们发现,在提示中包含词典条目以及通过TF-IDF和语义嵌入检索的混合句子,能显著提升翻译质量。然而,我们的结果揭示了不同测试集之间翻译性能的显著差异:在语言手册材料上的BLEU分数高达21.2,而在母语者提供的测试集上最高仅为4.4。这些结果强调了多样化和代表性语料库在评估低资源语言机器翻译中的重要性。我们的研究为低资源机器翻译的少样本LLM提示提供了见解,并为曼拜语提供了初始语料库。
引用
@article{arxiv.2404.04809,
title = {Low-Resource Machine Translation through Retrieval-Augmented LLM Prompting: A Study on the Mambai Language},
author = {Raphaël Merx and Aso Mahmudi and Katrina Langford and Leo Alberto de Araujo and Ekaterina Vylomova},
journal= {arXiv preprint arXiv:2404.04809},
year = {2025}
}