BEnQA:面向孟加拉语和英语的问答与推理基准数据集
计算与语言
2024-03-19 v1
摘要
本研究引入BEnQA数据集,该数据集包含约5000个涵盖科学教育多个学科的平行孟加拉语和英语中小学及高中考试题目,题目类型包括事实性、应用性和推理性问题。我们对多个大语言模型(LLMs)进行基准测试,发现模型在孟加拉语和英语之间的性能存在显著差异。我们还探讨了一些提示方法,发现链式思维提示在推理类问题上效果良好,但在事实类问题上效果有限。我们发现在孟加拉语问题后追加英语翻译有助于解答问题。我们的发现指向了改善大语言模型在孟加拉语乃至更广泛低资源语言性能的有前景的研究方向。
引用
@article{arxiv.2403.10900,
title = {BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English},
author = {Sheikh Shafayat and H M Quamran Hasan and Minhajur Rahman Chowdhury Mahim and Rifki Afina Putri and James Thorne and Alice Oh},
journal= {arXiv preprint arXiv:2403.10900},
year = {2024}
}