IndicEval:面向大语言模型的双语印度教育评估框架
计算与语言
2026-02-19 v1 人工智能
摘要
大语言模型(LLM)的快速发展 necessitates 能够反映真实学术严谨性和多语言复杂性的评估框架。本文介绍 IndicEval,一个可扩展的基准平台,旨在使用来自 UPSC、JEE 和 NEET 的真实高难度考试题目,横跨 STEM 和人文领域,同时以英语和印地语进行评估。不同于合成基准,IndicEval 以真实考试标准为评估依据,实现对推理、领域知识和双语适应性的真实测量。该框架采用 Zero-Shot、Few-Shot 和链式思维(Chain-of-Thought, CoT)提示策略进行自动化评估,并支持模块化集成新的模型和语言。在对 Gemini 2.0 Flash、GPT-4、Claude 和 LLaMA 3-70B 进行实验后,发现三个主要发现:首先,CoT 提示在推理准确率上 consistently 获得显著提升,尤其在不同科目和语言之间表现突出。其次,显著的跨模型性能差异仍然存在,尤其在高难度考试中尤为明显。第三,在印地语相对于英语的准确率下降仍是一个关键挑战,尤其在 Zero-Shot 条件下表现尤为突出。这些结果凸显了双语推理和领域迁移中的持久差距。总体而言,IndicEval 提供了一个以实践为导向、可扩展的框架,为在多语言教育环境中对大语言模型进行严谨、公平的评估,同时为改进推理鲁棒性和语言适应性提供了可操作的见解。
引用
@article{arxiv.2602.16467,
title = {IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models},
author = {Saurabh Bharti and Gaurav Azad and Abhinaw Jagtap and Nachiket Tapas},
journal= {arXiv preprint arXiv:2602.16467},
year = {2026}
}