中文

注意空隙或不注意?翻译错误与评估细节如何扭曲多语言结果

计算与语言 2025-11-10 v1

摘要

大多数当前大型语言模型(LLM)支持除英语外的多种语言,包括高资源语言(如德语、中文、法语)以及低资源语言(如斯瓦希里语、泰卢固语)。此外,它们还在诸多领域展现出惊人的能力,如编程、科学和数学。在本短文中,以数学为例域,研究不同大型语言模型在不同语言上的表现。实验结果表明,模型在不同语言之间的性能存在显著且持续的差距。有趣的是,尽管有些预期,差距同时存在于高资源和低资源语言之间。我们希望这些结果能影响未来针对下一代大型语言模型跨语言能力泛化的研究。如果不因为它们是假的!通过分析一种标准的多语言数学基准(MGSM),我们确定该数据集中存在若干翻译错误。此外,缺乏对大型语言模型输出中答案提取的标准化处理进一步影响最终结果。我们提出了一种用于大规模自动质量保证的方法,以解决第一个问题,并给出针对第二个问题的建议。将这两种方法结合起来,我们显示,此前提到的语言差距大多数情况下消失了,导致我们的研究结论发生完全不同的变化。我们此外已向社区发布了纠正后的数据集。

关键词

引用

@article{arxiv.2511.05162,
  title  = {Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results},
  author = {Jan-Thorsten Peter and David Vilar and Tobias Domhan and Dan Malkin and Markus Freitag},
  journal= {arXiv preprint arXiv:2511.05162},
  year   = {2025}
}