中文

IndicMMLU-Pro:评估印度语言大型语言模型的多任务语言理解基准

计算与语言 2025-01-29 v2 人工智能

摘要

印度次大陆超过15亿人口的印度语言因其丰富的文化遗产、语言多样性和复杂结构,为自然语言处理(NLP)研究带来了独特的挑战和机遇。IndicMMLU-Pro是一个全面的基准,旨在评估跨印度语言的大型语言模型(LLM),建立在MMLU Pro(Massive Multitask Language Understanding)框架之上。覆盖印地语、孟加拉语、古吉拉特语、马拉拉伊语、卡纳达语、旁遮巴语、泰米尔语、泰卢固语和乌尔都语等主要语言,旨在捕捉印度次大陆语言多样性所呈现的独特挑战和机遇。该基准涵盖语言理解、推理和生成中的广泛任务,精心构建以捕捉印度语言的细微差别。IndicMMLU-Pro为推动印度语言AI研究的边界,促进开发更准确、更高效、更具文化敏感性的模型。本文概述了基准的设计原则、任务分类和数据收集方法,并呈现了来自最先进多语言模型的基线结果。

关键词

引用

@article{arxiv.2501.15747,
  title  = {IndicMMLU-Pro: Benchmarking Indic Large Language Models on Multi-Task Language Understanding},
  author = {Sankalp KJ and Ashutosh Kumar and Laxmaan Balaji and Nikunj Kotecha and Vinija Jain and Aman Chadha and Sreyoshi Bhaduri},
  journal= {arXiv preprint arXiv:2501.15747},
  year   = {2025}
}