中文

INDIC QA 基准:用于评估印地语言大语言模型问答能力的多语言基准

机器学习 2025-02-25 v2

摘要

大语言模型 (LLM) 在英语上的未见任务上表现良好,但在非英语语言的能力研究不足,这主要源于基准数据和训练数据的局限。为弥合这一差距,我们介绍了 INDIC QA 基准,这是一个大型数据集,用于 11 种主要印度语言的上下文 grounding 问答,涵盖抽取式和抽象式任务。对多语言 LLM(包括指令微调版本)的评估显示,低资源语言性能较弱,这源于其训练数据对英语的强烈偏好。我们还研究了 Translate Test 范式,即将输入翻译为英语进行处理,然后将结果翻译回源语言输出。该方法在低资源环境中优于多语言 LLM。通过发布 INDIC QA,我们旨在促进针对低资源语言的 LLM 问答能力的进一步研究。该基准提供了关键资源,以解决现有局限性并促进多语言理解。

关键词

引用

@article{arxiv.2407.13522,
  title  = {INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic Languages},
  author = {Abhishek Kumar Singh and Vishwajeet kumar and Rudra Murthy and Jaydeep Sen and Ashish Mittal and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2407.13522},
  year   = {2025}
}