中文

大型推理模型能否在感知不确定性下进行类比推理?

人工智能 2025-06-05 v2 机器学习

摘要

本工作对两个最先进的大型推理模型(LRMs),即 OpenAI 的 o3-mini 和 DeepSeek R1,在类比推理方面进行了首次评估,重点关注基于 Raven 渐进矩阵的成熟非言语人类智商测试。我们使用 I-RAVEN 数据集及其扩展版 I-RAVEN-X 进行基准测试,后者测试了泛化到更长推理规则和属性值范围的能力。为了评估视觉不确定性对这些符号类比推理测试的影响,我们扩展了原本假设完美感知的 I-RAVEN-X 数据集。我们采用双重策略来模拟这种不完美的视觉感知:1)引入混淆属性,这些属性随机采样,不助于预测谜题的正确答案;2)平滑输入属性值的分布。我们观察到 OpenAI 的 o3-mini 任务准确率急剧下降,从原始 I-RAVEN 上的 86.6% 降至更具挑战性的 I-RAVEN-X 上的仅 17.0%——接近随机概率,而 I-RAVEN-X 增加了输入长度和范围并模拟了感知不确定性。尽管消耗了 3.4 倍的推理 token,这种下降依然发生。DeepSeek R1 也呈现出类似趋势:从 80.6% 降至 23.2%。另一方面,在 I-RAVEN 上取得最先进性能的神经符号概率溯因模型 ARLC,能够在所有这些分布外测试中稳健推理,保持较高准确率,仅从 98.6% 适度下降至 88.0%。我们的代码可在 https://github.com/IBM/raven-large-language-models 获取。

关键词

引用

@article{arxiv.2503.11207,
  title  = {Can Large Reasoning Models do Analogical Reasoning under Perceptual Uncertainty?},
  author = {Giacomo Camposampiero and Michael Hersche and Roger Wattenhofer and Abu Sebastian and Abbas Rahimi},
  journal= {arXiv preprint arXiv:2503.11207},
  year   = {2025}
}

备注

Accepted at the 19th International Conference on Neural-Symbolic Learning and Reasoning (NeSy) 2025