中文

基于多跳推理视角的中文常识推理基准测试

计算与语言 2025-10-13 v1 人工智能

摘要

尽管大型语言模型(LLMs)已在常识推理方面表现出先进能力,但其在一般中文语境下的全面评估仍存研究空白。为弥合这一差距,我们提出了中文常识多跳推理基准(CCMOR),以评估LLMs将中文特定事实知识与多步骤逻辑推理相结合的能力。具体而言,我们首先从现有问答数据集中构建领域均衡的种子集,然后开发基于LLM的管道,用于生成以事实单元链为锚点的多跳问题。为确保数据集质量,我们实施了人类-in-the-loop验证系统,由领域专家系统性地验证和细化生成的问题。使用CCMOR,我们评估了最先进的LLMs,显示其在处理长尾知识和执行知识密集型推理方面仍存在局限。值得注意的是,检索增强生成显著缓解了这些知识差距,带来了显著的性能提升。

关键词

引用

@article{arxiv.2510.08800,
  title  = {Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective},
  author = {Wangjie You and Xusheng Wang and Xing Wang and Wenxiang Jiao and Chao Feng and Juntao Li and Min Zhang},
  journal= {arXiv preprint arXiv:2510.08800},
  year   = {2025}
}