IndicParam:用于评估低资源印地语言 LLM 的基准
计算与语言
2026-01-13 v2
摘要
虽然大型语言模型在高资源多语言任务中表现出色,但低资源和极低资源的印度语言仍严重未被评估。我们提出 IndicParam,一个人工筛选的包含超过 13,000 个多选题的基准,覆盖 11 种语言(尼泊尔语、古吉拉特语、马拉纳语、奥利亚语为低资源;Dogri、Maithili、Rajasthani、Sanskrit、Bodo、Santali、Konkani 为极低资源)以及梵文-英语代码混合集合。我们对 20 个大型语言模型(包括专有和开源权重模型)进行了评估,结果显示即使是表现最好的 \texttt{Gemini-2.5} 也仅达到 58% 的平均准确率,其后是 \texttt{GPT-5}(45%)和 \texttt{DeepSeek-3.2}(43.1%)。我们还将每个问题标记为知识导向或纯语言导向,以区分事实记忆和语法熟练程度。进一步,我们评估了 LLM 处理多样化问题格式的能力,如基于列表的匹配、断言-原因配对和序列排序,以及传统的多选题。\benchmark 提供了跨语言迁移局限性的洞察,并为印度语言建立了一个具有挑战性的基准。该数据集可在 https://huggingface.co/datasets/bharatgenai/IndicParam 获取。运行基准的脚本可在 https://github.com/ayushbits/IndicParam 获取。
引用
@article{arxiv.2512.00333,
title = {IndicParam: Benchmark to evaluate LLMs on low-resource Indic Languages},
author = {Ayush Maheshwari and Kaushal Sharma and Vivek Patel and Aditya Maheshwari},
journal= {arXiv preprint arXiv:2512.00333},
year = {2026}
}