中文

测试机器翻译的极限:从一本书进行

计算与语言 2025-08-12 v1

摘要

当前最先进的模型展示了能够利用零样本学习翻译到先前未见的语言语境的能力。Tanzer 等人 [2024] 利用语言材料(例如语法)以改进 Kalamang 语言的翻译质量。我们聚焦于 Kanuri 语言,该语言尽管拥有大量说话者,却在数字资源方面极其匮乏。我们设计了两个数据集用于评估:一个聚焦于健康和人道主义术语,另一个包含通用术语,探讨了特定领域任务对 LLM 翻译质量的影响。通过提供不同的语言资源(语法、词典和平行句子),我们衡量了 LLM 翻译的有效性,将结果与母语者翻译和人类语言学家的表现进行比较。我们使用了自动度量标准以及母语者对流畅性和准确性的评估。结果表明,平行句子是最有效的数据源,在人类评估和自动度量方面均优于其他方法。虽然将语法纳入翻译可提升零样本翻译的效果,但作为独立的数据源时并不有效。人类评估揭示了 LLM 在准确性(意义)方面的表现优于流畅性(语法性)。这些发现表明,LLM 翻译评估受益于超越简单准确性度量的多维度评估,而语法本身,没有平行句子,无法为有效的特定领域翻译提供足够的上下文。

关键词

引用

@article{arxiv.2508.06665,
  title  = {Testing the Limits of Machine Translation from One Book},
  author = {Jonathan Shaw and Dillon Mee and Timothy Khouw and Zackary Leech and Daniel Wilson},
  journal= {arXiv preprint arXiv:2508.06665},
  year   = {2025}
}