“梦见了吗”:通过机器翻译评估视角的多语言大语言模型评估
计算与语言
2025-09-15 v4 人工智能
摘要
多语言大语言模型(mLLMs)的生成能力和语言覆盖正在迅速提升。然而,针对mLLMs生成能力的评估实践仍缺乏全面性、科学严谨性和在研究实验室中的一致采纳,这削弱了其有意义指导mLLM开发的潜力。我们拊藉机器翻译(MT)评估的经验,该领域数十年来面临类似挑战,已发展出透明报告标准和可靠的评估方法,用于评估多语言生成模型。通过针对生成评估管道的关键阶段进行针对性实验,我们展示了如何将MT评估的最佳实践深化对模型之间质量差异的理解。此外,我们确定了用于严密评估mLLMs的必要要素,确保评估方法本身得到严格评估。我们将这些见解提炼为一套可操作的建议清单,用于mLLM研究和开发。
引用
@article{arxiv.2504.11829,
title = {D\'ej\`a Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation},
author = {Julia Kreutzer and Eleftheria Briakou and Sweta Agrawal and Marzieh Fadaee and Kocmi Tom},
journal= {arXiv preprint arXiv:2504.11829},
year = {2025}
}