中文

MILU:一个多任务印度语言理解基准

计算与语言 2025-02-05 v3

摘要

在低资源和语言多样化的语言中评估大语言模型(LLM)仍然是NLP中的一个重大挑战,特别是对于使用非拉丁文字的语言,如印度语言。现有的基准主要关注英语,在评估LLM在这些语言中的能力方面存在显著空白。我们提出了MILU,一个多任务印度语言理解基准,一个旨在解决这一空白的全面评估基准。MILU涵盖11种印度语言中的8个领域和41个主题,反映了通用和文化特定的知识。采用以印度为中心的设计,包含了来自地区和州级考试的材料,涵盖当地历史、艺术、节日和法律等主题,以及科学和数学等标准学科。我们评估了42多个LLM,发现当前LLM在MILU上表现不佳,GPT-4o取得了最高的平均准确率74%。开放多语言模型的表现优于语言特定微调模型,后者的表现仅略好于随机基线。模型在资源丰富的语言中的表现优于资源匮乏的语言。领域分析表明,模型在艺术与人文、法律与治理等文化相关领域的表现不如STEM等通用领域。据我们所知,MILU是首个专注于印度语言的基准,是全面文化评估的关键一步。所有代码、基准和工具均公开发布以促进开放研究。

关键词

引用

@article{arxiv.2411.02538,
  title  = {MILU: A Multi-task Indic Language Understanding Benchmark},
  author = {Sshubam Verma and Mohammed Safi Ur Rahman Khan and Vishwajeet Kumar and Rudra Murthy and Jaydeep Sen},
  journal= {arXiv preprint arXiv:2411.02538},
  year   = {2025}
}