西班牙语与大语言模型基准测试:MMLU在翻译中迷失了吗?
计算与语言
2024-06-27 v1 人工智能
摘要
大语言模型(LLM)的评估是其持续改进过程中的关键要素,许多基准测试已被开发用于评估LLM在不同任务和主题上的性能。随着LLM在全球范围内被采用,用英语以外的语言评估它们变得越来越重要。然而,大多数LLM基准测试只是使用自动化工具进行翻译,然后在目标语言中运行。这意味着结果不仅取决于LLM在该语言中的性能,还取决于翻译的质量。在本文中,我们考虑了著名的MMLU(大规模多任务语言理解)基准测试的情况。该基准测试的选定类别使用Azure Translator和ChatGPT4翻译成西班牙语,并在ChatGPT4上运行。接下来,对结果进行处理,以识别在西班牙语和英语中产生不同答案的测试项。然后对这些项进行人工分析,以了解自动翻译是否导致了变化。结果表明,很大一部分失败的项可归因于基准测试翻译中的错误。这些结果有力地证明了,至少通过修订测试项的翻译,并最好由专家将测试适应目标语言,来改进非英语语言的基准测试。
引用
@article{arxiv.2406.17789,
title = {Spanish and LLM Benchmarks: is MMLU Lost in Translation?},
author = {Irene Plaza and Nina Melero and Cristina del Pozo and Javier Conde and Pedro Reviriego and Marina Mayor-Rocher and María Grandury},
journal= {arXiv preprint arXiv:2406.17789},
year = {2024}
}