中文

L3Cube-IndicQuest:用于评估LLM在印度语环境中知识的基准问答数据集

计算与语言 2024-10-31 v2 机器学习

摘要

大型语言模型(LLM)在将印度语言纳入多语言模型方面取得了重大进展。然而,定量评估这些语言的表现是否与英语等主流语言相当至关重要。目前,缺乏专门设计用于评估LLM在各种印度语言中区域知识的基准数据集。在本文中,我们提出了L3Cube-IndicQuest,一个金标准的事实性问答基准数据集,旨在评估多语言LLM如何捕捉跨多种印度语言的区域知识。该数据集包含200个问答对,分别针对英语和19种印度语言,涵盖特定于印度地区的五个领域。我们希望该数据集能作为一个基准,为评估LLM在理解和表示与印度背景相关知识方面的表现提供真实依据。IndicQuest既可用于基于参考的评估,也可用于LLM作为评判者的评估。该数据集已在https://github.com/l3cube-pune/indic-nlp 公开共享。

关键词

引用

@article{arxiv.2409.08706,
  title  = {L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context},
  author = {Pritika Rohera and Chaitrali Ginimav and Akanksha Salunke and Gayatri Sawant and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2409.08706},
  year   = {2024}
}

备注

Accepted at PACLIC 38 (2024)