中文

MiLiC-Eval:针对中国少数民族语言的多语言 LLM 基准测试

计算与语言 2025-06-03 v2

摘要

大型语言模型(LLM)在高资源语言中表现出色,但在低资源语言(LRL)中表现不佳,尤其是中国少数民族社区所使用的语言,如藏语、维吾尔语、哈萨克语和蒙古语。为系统跟踪这些语言的进展,本文引入 MiLiC-Eval,一个针对中国少数民族语言的基准测试,包含 24K 个实例覆盖 9 个任务。MiLiC-Eval 关注被边缘化的书写系统,其任务与语言之间的平行性可提供对语言和问题解决技能的忠实且细粒度的评估。我们的评估显示,开源 LLM 在语法密集型任务和多脚本语言上表现不佳。我们进一步演示了 MiLiC-Eval 有助于推动 LRL research 在处理多样书写系统和理解语言适应过程方面的进展。

关键词

引用

@article{arxiv.2503.01150,
  title  = {MiLiC-Eval: Benchmarking Multilingual LLMs for China's Minority Languages},
  author = {Chen Zhang and Mingxu Tao and Zhiyuan Liao and Yansong Feng},
  journal= {arXiv preprint arXiv:2503.01150},
  year   = {2025}
}

备注

ACL 2025 (Findings) Code and data available at https://github.com/luciusssss/MiLiC-Eval