大型语言模型是否具备深层关系推理能力?来自DeepSeek-R1及基准比较的启示
人工智能
2025-07-01 v1
摘要
大型语言模型(LLMs)在执行深层关系推理方面达到了什么程度?本文通过设计一套仔细构建的基准任务,对比评估了三种前沿大型语言模型,即DeepSeek-R1、DeepSeek-V3和GPT-4o,其在家庭树和一般图推理中的推理能力。我们的实验表明,DeepSeek-R1在多个任务和问题规模上始终取得最高的F1分数,显示出在逻辑推理和关系推断方面的强烈倾向。然而,所有评估的模型包括DeepSeek-R1在问题复杂度增加时表现显著下降,主要由于标记长度限制和输出结构不完整。对DeepSeek-R1长链思维响应的详细分析揭示了其独特的规划和验证策略,但也指出了推理不连贯或不完整的实例,呼吁对LLMs内部推理动力学进行更深入的审查。我们进一步讨论了未来工作的关键方向,包括多模态推理和系统性检查查推理失败。我们的发现为推进LLMs在需要结构化、多步骤逻辑推断的任务方面的推理能力提供了实证见解和理论意义。我们的代码仓库将在https://github.com/kelvinhkcs/Deep-Relational-Reasoning公开。
关键词
引用
@article{arxiv.2506.23128,
title = {Are Large Language Models Capable of Deep Relational Reasoning? Insights from DeepSeek-R1 and Benchmark Comparisons},
author = {Chi Chiu So and Yueyue Sun and Jun-Min Wang and Siu Pang Yung and Anthony Wai Keung Loh and Chun Pong Chau},
journal= {arXiv preprint arXiv:2506.23128},
year = {2025}
}
备注
10 pages, 0 figures, accepted by 2025 IEEE international conference on artificial intelligence testing (AITest)