中文

IndicGenBench:评估 LLMs 在印度语言上生成能力的多语言基准

计算与语言 2024-08-09 v2

摘要

随着大型语言模型(LLMs)在全球范围内的日益普及,LLMs 必须能够代表世界语言的多样性。印度是一个拥有 14 亿人口的语言多样化国家。为了促进多语言 LLM 评估的研究,我们发布了 IndicGenBench——这是用于评估 LLMs 在涵盖 13 种文字和 4 个语系的 29 种不同印度语言上执行面向用户生成任务的最大基准。IndicGenBench 由跨语言摘要、机器翻译和跨语言问答等多种生成任务组成。IndicGenBench 通过人工筛选将现有基准扩展至多种印度语言,首次为许多代表性不足的印度语言提供了多向平行评估数据。我们在多种设置下评估了包括 GPT-3.5、GPT-4、PaLM-2、mT5、Gemma、BLOOM 和 LLaMA 在内的多种专有和开源 LLMs。最大的 PaLM-2 模型在大多数任务上表现最佳,然而,所有语言与英语相比均存在显著的性能差距,表明需要进一步研究以开发更具包容性的多语言语言模型。IndicGenBench 已在 www.github.com/google-research-datasets/indic-gen-bench 发布。

关键词

引用

@article{arxiv.2404.16816,
  title  = {IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages},
  author = {Harman Singh and Nitish Gupta and Shikhar Bharadwaj and Dinesh Tewari and Partha Talukdar},
  journal= {arXiv preprint arXiv:2404.16816},
  year   = {2024}
}

备注

ACL 2024