ParamBench:评估大语言模型对印度学科理解能力的研究生级别基准测试
计算与语言
2025-10-09 v2
摘要
大语言模型已在理解、摘要生成、代码生成等任务上得到广泛评估。然而,它们在印度语境下研究生级别的、文化背景深厚的问答上的表现仍 largely 未被探索。现有的印度基准测试强调基本事实导向的查询,仅提供对印度特定深层学科理解的有限评估。在本文中,我们提出了ParamBench,包含超过17K个印地语问题,涵盖21个不同学科的问卷。这些问题主要来自一场全国性的研究生级别入学考试,涵盖历史、音乐、乐器、瑜伽、文学、哲学、法律等主题——专门针对印度语境。此外,我们评估了大语言模型处理多种问题格式的能力——如列表匹配、断言-理由对和序列排序——以及传统的选择题。我们在该基准上评估了超过16个开源大语言模型的性能,发现Gemma3-27B取得了最高的总体准确率56.4%。此外,学科层面的分析表明,即使对于表现最好的大语言模型,在音乐、古典乐器和法律等主题上的表现仍然较弱,突显了文化背景推理中的持续挑战。数据集和源代码位于https://github.com/ayushbits/ParamBench。
引用
@article{arxiv.2508.16185,
title = {ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects},
author = {Ayush Maheshwari and Kaushal Sharma and Vivek Patel and Aditya Maheshwari},
journal= {arXiv preprint arXiv:2508.16185},
year = {2025}
}