中文

以推理补偿数据:基于 LLM 的低资源机器翻译

计算与语言 2025-05-29 v1

摘要

大型语言模型 (LLMs) 在多语言机器翻译中展现出了强大的能力,有时甚至超越了传统的神经系统。然而,先前的研究强调了在低资源语言中使用 LLMs(特别是通过提示工程)的挑战。在这项工作中,我们引入了 Fragment-Shot Prompting,这是一种新颖的上下文学习方法,它对输入进行分段并基于句法覆盖检索翻译示例;同时引入了 Pivoted Fragment-Shot,这是一种无需直接平行数据即可进行翻译的扩展。我们使用 GPT-3.5、GPT-4o、o1-mini、LLaMA-3.3 和 DeepSeek-R1 评估了这些方法在意大利语和两种 Ladin 变体之间的翻译,揭示了三个关键发现:(1) Fragment-Shot Prompting 对于翻译成所研究的低资源语言以及在它们之间进行翻译是有效的,句法覆盖与翻译质量呈正相关;(2) 具有更强推理能力的模型能更有效地利用检索到的知识,通常产生更好的翻译,并使 Pivoted Fragment-Shot 能够显著提高 Ladin 变体之间的翻译质量;(3) 当从低资源语言翻译为高资源语言时,提示工程提供的改进微乎其微甚至没有,此时零样本提示已经产生了令人满意的结果。我们公开发布了我们的代码和检索语料库。

关键词

引用

@article{arxiv.2505.22293,
  title  = {Compensating for Data with Reasoning: Low-Resource Machine Translation with LLMs},
  author = {Samuel Frontull and Thomas Ströhle},
  journal= {arXiv preprint arXiv:2505.22293},
  year   = {2025}
}