BnMMLU:衡量巴印格语大规模多任务语言理解
计算与语言
2026-01-13 v2
摘要
大规模多任务基准测试推动了语言建模的快速进展,但大多数基准测试侧重高资源语言,如英语,使巴印格语处于欠represented 状态。我们提出 BnMMLU,一个用于衡量巴印格语大规模多任务语言理解的综合基准测试。BnMMLU 涵盖 STEM、人文、社会科学和一般知识等 41 个领域,包含 134,375 个多选题-选项对--目前最全面的巴印格语评估套件。数据集保留了数学内容的 MathML,并包括 BnMMLU-HARD——从 top 系统最常忽略的问题中构建的紧凑子集,以检验困难案例。我们对 24 个模型变体进行基准测试,涵盖 11 个 LLM 家族,包括开源通用/多语言、巴印格语专用开源和专有模型,覆盖多个参数规模和指令微调设置。我们在标准化协议下评估模型,涵盖两种提示样式(直接式 vs. 链式思考)和两种上下文情境(0-shot vs. 5-shot),在各家族中报告准确率。我们的分析突显了推理和应用技能的持续差距,并指示模型规模的亚线性回报。我们发布数据集和评估模板,以支持对巴印格语语言理解进行严谨、可重复的评估,并催化多语言 NLP 的进展。
关键词
引用
@article{arxiv.2505.18951,
title = {BnMMLU: Measuring Massive Multitask Language Understanding in Bengali},
author = {Saman Sarker Joy and Swakkhar Shatabda},
journal= {arXiv preprint arXiv:2505.18951},
year = {2026}
}
备注
19 Pages, 10 Tables, 12 Figures