通过动态推理评估真正衡量大型语言模型的流体智力
人工智能
2025-09-30 v2
摘要
大型语言模型(LLM)的最新进展展示了令人印象深刻的推理能力,这些能力反映了类似人类的思维。然而,LLM 是否具备真正的流体智力(即在新颖情况下进行抽象推理和泛化规则的能力)仍然是一个悬而未决的问题。现有的推理基准要么侧重于特定领域的知识(晶体智力),要么缺乏可解释性。为了解决这些局限性,我们提出了 DRE-Bench,这是一个基于分层认知框架的动态推理评估基准。DRE-Bench 包含 36 个抽象推理任务,组织在四个认知层级上,每个任务都有多个动态变体,用于测试相同的潜在规则。这种设计能够对流体智力进行细粒度、可解释且可靠的评估。我们评估了一系列最先进的 LLM,包括通用 LLM(GPT-4o、Claude 3.7)和推理 LLM(o1、DeepSeek-R1、QwQ、Skywork-OR1)。实验结果表明,尽管大多数 LLM 在低级认知中表现出胜任且稳健的性能,但它们在高级认知中遇到困难,并且随着任务复杂度的增加表现出有限的泛化能力。我们的发现突出了当前 LLM 与真正类似人类的流体智力之间的差距,并为系统地跟踪 LLM 的推理进展提供了一条新途径。
引用
@article{arxiv.2506.02648,
title = {Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation},
author = {Yue Yang and MingKang Chen and Qihua Liu and Mengkang Hu and Qiguang Chen and Gengrui Zhang and Shuyue Hu and Guangtao Zhai and Yu Qiao and Yu Wang and Wenqi Shao and Ping Luo},
journal= {arXiv preprint arXiv:2506.02648},
year = {2025}
}