中文

来自 2000 多个多语言基准的苦涩教训

计算与语言 2025-04-23 v1

摘要

随着大型语言模型 (LLM) 在语言能力方面的持续进步,针对多语言评估的需求日益重要,以促进公平的技术进步。本立场论文考察了自 2021 年至 2024 年间发表的 148 个国家超过 2000 个多语言(非英语)基准,以评估过去、现在和未来在多语言基准测试中的实践。我们的发现表明,尽管投入了数百万美元的资金,英语在这些基准中仍显著过度代表。此外,大多数基准依赖原始语言内容而非翻译,主要来源于中国、印度、德国、英国和美国等高资源国家。进一步地,将基准性能与人类判断进行比较,揭示了显著的差异。STEM 相关任务在人类评估中表现出强相关性(0.70 到 0.85),而传统 NLP 任务如问答 (例如 XQuAD) 则显示出 much weaker 的相关性(0.11 到 0.30)。此外,翻译英语基准以其他语言证明不足,因为本地化基准显示出显著更高的对当地人类判断的对齐度(0.68)相对于其翻译版本(0.47)。这凸显了创建符合文化和语言特性的基准而非仅依赖翻译的重要性。通过这项全面的分析,我们概述了当前多语言评估实践中的六个关键局限性,提出了相应的指导原则,以进行有效的多语言基准测试,并概述了推动该领域进步的五个关键研究方向。最后,我们呼吁全球合作努力开发符合人类判断的基准,优先考虑实际应用。

关键词

引用

@article{arxiv.2504.15521,
  title  = {The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks},
  author = {Minghao Wu and Weixuan Wang and Sinuo Liu and Huifeng Yin and Xintong Wang and Yu Zhao and Chenyang Lyu and Longyue Wang and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2504.15521},
  year   = {2025}
}

备注

work in progress; 22 pages, 8 figures, 3 tables;