中文

评估逻辑推理阅读理解中批判性推理的原理理解能力

计算与语言 2023-12-01 v1

摘要

为精确评估语言模型的逻辑阅读理解能力,我们提出一个用于测试批判性推理背后原理理解的数据集。针对从现有多选逻辑阅读理解数据集中选取的问题,我们通过众包获取解释为何应选择或排除答案选项的原理文本,从而得到与943个主问题相关联的3003个多选子问题。在我们的数据集上的实验表明,近期的大语言模型(如InstructGPT)即便能够正确回答主问题,仍难以回答子问题。我们发现,模型在回答为主问题的错误选项所写的子问题时表现尤其差,意味着模型在解释为何应排除错误备选项方面的能力有限。这些结果表明,我们的数据集在推动进一步探究语言模型批判性推理能力的同时,聚焦于相关备选项的排除过程。

关键词

引用

@article{arxiv.2311.18353,
  title  = {Evaluating the Rationale Understanding of Critical Reasoning in Logical Reading Comprehension},
  author = {Akira Kawabata and Saku Sugawara},
  journal= {arXiv preprint arXiv:2311.18353},
  year   = {2023}
}

备注

Accepted to EMNLP 2023