中文

超越多示例翻译:扩展低资源机器翻译的上下文内演示

计算与语言 2026-02-05 v1

摘要

为低资源语言构建机器翻译(MT)系统由于高质量数据的稀缺而尤为困难。尽管大型语言模型(LLM)提高了MT系统的性能,但将其适应于代表性不足的语言仍然具有挑战性。上下文内学习(ICL)可能通过在推理时以演示为条件来提供适应LLM进行低资源MT的新方法。在本研究中,我们探索将低资源机器翻译ICL扩展到超越少样本设置,使用长上下文模型处理数千个示例。我们将上下文内令牌预算扩展到100万令牌,并比较了用作上下文内监督的三种训练语料库类型:单语无监督数据、指令风格数据和并行数据(英语-目标语言和印度尼西亚语-目标语言)。我们在爪哇语和巽他语上的实验表明,额外上下文的收益会迅速饱和,并可能在接近最大上下文窗口时下降,缩放行为强烈依赖于语料库类型。值得注意的是,某些形式的单语监督可以与并行数据竞争,尽管后者提供了额外的监督。总的来说,我们的结果刻画了低资源MT长上下文ICL的有效限制和语料库类型敏感性,强调更大的上下文窗口不一定带来成比例的质量提升。

关键词

引用

@article{arxiv.2602.04764,
  title  = {Beyond Many-Shot Translation: Scaling In-Context Demonstrations For Low-Resource Machine Translation},
  author = {Luis Frentzen Salim and Esteban Carlin and Alexandre Morinvil and Xi Ai and Lun-Wei Ku},
  journal= {arXiv preprint arXiv:2602.04764},
  year   = {2026}
}

备注

8 pages, 18 figures, EACL 2026 Conference - LoResMT workshop