Marco-Bench-MIF:大型语言模型多语言指令遵循能力评估基准
计算与语言
2025-07-17 v1
摘要
指令遵循能力已成为大型语言模型(LLM)评估的关键能力之一。然而,现有数据集如 IFEval 要么主要是单语且以英文为中心,要么仅是简单机械翻译成其他语言,限制了其在多语言语境下的适用性。本文提出了一个精心策划的 IFEval 多语言版本扩展,即 Marco-Bench-MIF,覆盖 30 种语言且具有不同程度的本地化。我们的基准通过结合翻译与验证的混合管道来解决语言约束(如中文大小写要求)和文化差异(如替换区域特定公司名称)。通过对 20 多种 LLM 在 Marco-Bench-MIF 上的全面评估,我们发现:(1) 高/低资源语言之间存在 25-35% 的准确率差距;(2) 模型规模对性能影响约 45-60%,但仍存在脚本特定挑战;(3) 机器翻译数据相对于本地化数据低估 7-22% 的准确率。我们的分析识别了多语言指令遵循中的挑战,包括跨语言保持关键词一致性和跨语言组合约束遵循。Marco-Bench-MIF 已开源发布于 https://github.com/AIDC-AI/Marco-Bench-MIF。
引用
@article{arxiv.2507.11882,
title = {Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models},
author = {Bo Zeng and Chenyang Lyu and Sinuo Liu and Mingyan Zeng and Minghao Wu and Xuanfan Ni and Tianqi Shi and Yu Zhao and Yefeng Liu and Chenyu Zhu and Ruizhe Li and Jiahui Geng and Qing Li and Yu Tong and Longyue Wang and Weihua Luo and Kaifu Zhang},
journal= {arXiv preprint arXiv:2507.11882},
year = {2025}
}
备注
ACL 2025 Main Conference paper