中文

批判性问题生成基准评测:大语言模型的一项挑战性推理任务

计算与语言 2025-09-24 v3

摘要

批判性问题生成(CQs-Gen)任务旨在通过使系统能够生成揭示潜在假设并挑战论证推理结构有效性的问题,来培养批判性思维。尽管该领域兴趣日益增长,但缺乏合适的数据集和自动评估标准阻碍了进展。本文提出了一种支持该任务系统开发和基准评测的综合方法。我们构建了首个大规模数据集,包含约 5,000 个手动标注的问题。我们还研究了自动评估方法,并提出基于参考的技术作为与人类判断相关性最高的策略。我们对 11 个 LLM 的零样本评估建立了一个强大的基线,同时展示了该任务的难度。我们提供了数据和代码以及一个公开排行榜,以鼓励进一步研究,不仅在模型性能方面,而且探索 CQs-Gen 对自动推理和人类批判性思维的实际益处。

关键词

引用

@article{arxiv.2505.11341,
  title  = {Benchmarking Critical Questions Generation: A Challenging Reasoning Task for Large Language Models},
  author = {Banca Calvo Figueras and Rodrigo Agerri},
  journal= {arXiv preprint arXiv:2505.11341},
  year   = {2025}
}