SCoRE:常识场景中的长链推理基准测试
计算与语言
2025-05-20 v2
摘要
当前,长链推理仍然是大型语言模型 (LLM) 的关键挑战,因为自然文本缺乏足够的显式推理数据。然而,现有的基准测试存在覆盖范围窄、推理路径短或构建成本高等局限性。我们引入了 SCoRE (Scenario-based Commonsense Reasoning Evaluation,基于场景的常识推理评估),这是一个从实体、关系和逻辑规则的场景模式中合成多跳问题以评估长链常识推理的基准测试。SCoRE 包含 10 万道双语(中英)多项选择题,其推理链跨越 2 至 11 跳,并被划分为不同的难度级别。每个问题均配有细粒度知识标签、显式推理链和难度级别,以用于诊断性评估。在 o3-mini 和 Deepseek R1 等前沿 LLM 上的评估结果表明,即使是最好的模型在 SCoRE 上也仅达到 69.78% 的准确率(在困难集上甚至仅为 47.91%),且错误通常源于罕见知识、逻辑不一致以及对简单问题的过度解读。SCoRE 提供了一个可扩展、可延伸的框架,用于评估和诊断 LLM 的长链常识推理能力,并指导未来在模型设计与训练方面的进展。
引用
@article{arxiv.2503.06218,
title = {SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios},
author = {Weidong Zhan and Yue Wang and Nan Hu and Liming Xiao and Jingyuan Ma and Yuhang Qin and Zheng Li and Yixin Yang and Sirui Deng and Jinkun Ding and Wenhan Ma and Rui Li and Weilin Luo and Qun Liu and Zhifang Sui},
journal= {arXiv preprint arXiv:2503.06218},
year = {2025}
}