中文

MRCEval:一个全面、具挑战性且易于访问的机器阅读理解基准

计算与语言 2025-03-11 v1 人工智能

摘要

机器阅读理解(MRC)是评估自然语言理解的一项重要任务。现有的 MRC 数据集主要评估阅读理解(RC)的特定方面,缺乏一个全面的 MRC 基准。为了填补这一空白,我们首先引入了一种新颖的分类法,对 RC 所需的关键能力进行分类。基于该分类法,我们构建了 MRCEval,这是一个利用先进的大语言模型(LLM)作为样本生成器和选择评判器的 MRC 基准。MRCEval 是一个全面、具挑战性且易于访问的基准,旨在彻底评估 LLM 的 RC 能力,涵盖 13 项不同的 RC 技能,共计 2.1K 道高质量的多项选择题。我们对 28 个广泛使用的开源和专有模型进行了广泛评估,强调即使在 LLM 时代,MRC 依然面临重大挑战。

关键词

引用

@article{arxiv.2503.07144,
  title  = {MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark},
  author = {Shengkun Ma and Hao Peng and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2503.07144},
  year   = {2025}
}

备注

Under review