M-IFEval:多语言指令遵循评估
计算与语言
2025-02-10 v1 人工智能
摘要
指令遵循是现代大语言模型(LLM)的核心能力,评估这一能力对于理解这些模型至关重要。文献中的指令遵循评估(IFEval)基准采用客观标准,提供一种无需主观AI或人类判断的LLM性能衡量标准。然而,其仅包含英文指令,限制了对其他语言中LLM能力的评估。我们提出了多语言指令遵循评估(M-IFEval)基准,将评估扩展至法语、日语和西班牙语,包含通用和语言特定指令。将该基准应用于8个最新AI模型后,我们发现语言和指令类型之间的基准性能差异巨大,这凸显了在多元文化背景下评估LLM的重要性。
引用
@article{arxiv.2502.04688,
title = {M-IFEval: Multilingual Instruction-Following Evaluation},
author = {Antoine Dussolle and Andrea Cardeña Díaz and Shota Sato and Peter Devine},
journal= {arXiv preprint arXiv:2502.04688},
year = {2025}
}