MaXIFE:多语言与跨语言指令遵循评估
计算与语言
2025-06-04 v2 人工智能
摘要
随着大语言模型 (LLM) 在自然语言处理中的快速采用,遵循指令的能力已成为评估其实用性的关键指标。然而,现有的评估方法通常侧重于单语言场景,忽略了多语言和跨语言背景下的挑战与差异。为了填补这一空白,我们引入了 MaXIFE:一个全面的评估基准,旨在评估 23 种不同语言中 1667 个可验证指令任务的指令遵循能力。MaXIFE 集成了基于规则的评估和基于模型的评估,确保了效率与准确性的平衡。我们应用 MaXIFE 评估了多个领先的商业 LLM,为未来的比较建立了基线结果。通过为多语言指令遵循评估提供标准化工具,MaXIFE 旨在推进自然语言处理的研究与开发。
引用
@article{arxiv.2506.01776,
title = {MaXIFE: Multilingual and Cross-lingual Instruction Following Evaluation},
author = {Yile Liu and Ziwei Ma and Xiu Jiang and Jinglu Hu and Jing Chang and Liang Li},
journal= {arXiv preprint arXiv:2506.01776},
year = {2025}
}
备注
ACL 2025 Main Conference