中文

往返翻译揭示了前沿多语言基准测试所遗漏的内容

计算与语言 2026-04-15 v1 人工智能

摘要

多语言基准测试指导着前沿模型的发展。然而,前沿模型报告的多语言评估在结构上类似于流行的推理和知识基准,但跨越多种语言。我们表明,此类基准测试以及随之而来的多语言评估,衡量的是数学推理和事实回忆,而非多语言能力。例如,思考变体在这些基准测试上的表现显著优于指令变体,但在现实世界的多语言任务(如LMArena)上往往表现更差。我们提出了一个简单的替代方案:通过往返翻译来评估多语言能力。给定源语言文本,将其翻译成目标语言再翻译回来;原文与结果之间的语义差距暴露了多语言生成能力的缺陷。在我们的基准测试中,往返翻译与LMArena上的用户评分几乎完全相关(\r{ho} = 0.94),不需要人工参考翻译,也不需要比被测模型更有能力的多语言评判者。最后,我们介绍了“迷失于翻译”(LiT),这是一个具有挑战性的往返翻译基准测试,涵盖全球广泛使用的语言,用于对前沿多语言模型进行现实评估。

关键词

引用

@article{arxiv.2604.12911,
  title  = {Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss},
  author = {Ronald Skorobogat and Ameya Prabhu and Matthias Bethge},
  journal= {arXiv preprint arXiv:2604.12911},
  year   = {2026}
}