中文

印地语大语言模型基准测试:全新数据集套件与比较分析

计算与语言 2025-10-16 v2 机器学习

摘要

评估印地语指令调优型大语言模型 (LLM) 具有挑战性,因为缺乏高质量基准数据集,直接翻译英文数据集无法捕捉关键的语言和文化细微差别。为此,我们引入一套五个印地语LLM评估数据集:IFEval-Hi、MT-Bench-Hi、GSM8K-Hi、ChatRAG-Hi 和 BFCL-Hi。这些数据集采用结合从零人类标注与翻译验证过程的 methodology 创建。我们利用这套数据集对支持印地语的开源LLM进行全面基准测试,提供其当前能力的详细比较分析。我们的 curated 过程也为开发其他低资源语言的基准数据集提供了可复制的 methodology。

关键词

引用

@article{arxiv.2508.19831,
  title  = {Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis},
  author = {Anusha Kamath and Kanishk Singla and Rakesh Paul and Raviraj Joshi and Utkarsh Vaidya and Sanjay Singh Chauhan and Niranjan Wartikar},
  journal= {arXiv preprint arXiv:2508.19831},
  year   = {2025}
}