BLUCK:面向孟加拉语语言理解与文化知识的基准数据集
计算与语言
2026-01-21 v2 人工智能
摘要
在本研究中,我们引入了 BLUCK,一个旨在衡量大语言模型(LLMs)在孟加拉语语言理解与文化知识方面表现的新数据集。我们的数据集包含 2366 道多项选择题(MCQs),精心编选自若干大学和职业级考试的汇编集合,涵盖 23 个类别,涉及孟加拉国文化与历史以及孟加拉语语言学知识。我们使用 6 个专有 LLM 和 3 个开源 LLM 对 BLUCK 进行了基准测试,包括 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro、Llama-3.3-70B-Instruct 和 DeepSeekV3。结果表明,尽管这些模型总体表现相当不错,但在孟加拉语语音学的某些领域仍存在困难。尽管当前 LLM 在孟加拉文化和语言上下文中的表现仍无法与英语等主流语言相媲美,但我们的结果表明了孟加拉语作为中等资源语言的地位。重要的是,BLUCK 也是首个以孟加拉本土文化、历史和语言学为中心的基于 MCQ 的评估基准。
引用
@article{arxiv.2505.21092,
title = {BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge},
author = {Daeen Kabir and Minhajur Rahman Chowdhury Mahim and Sheikh Shafayat and Adnan Sadik and Arian Ahmed and Eunsu Kim and Alice Oh},
journal= {arXiv preprint arXiv:2505.21092},
year = {2026}
}
备注
Accepted at BLP Workshop, IJCNLP-AACL 2025