中文

你的推理基准可能并不测试推理:揭示抽象推理基准中的感知瓶颈

计算与语言 2026-01-12 v2

摘要

诸如抽象推理语料库(ARC)和ARC-AGI等推理基准广泛用于评估人工智能进展,常被解释为探测核心所谓“流体”推理能力的手段。尽管对人类而言这些任务看似简单,但这些任务在面对前沿视觉-语言模型(VLMs)时仍显得具有挑战性,常将这一差距归因于机器推理的缺陷。我们挑战了这种解释,提出差距主要源于视觉感知的局限,而非归因于归纳推理的不足。在验证此假设后,我们引入了一个两阶段实验管道,显式地分离感知与推理。在感知阶段,每个图像独立地转换为自然语言描述;而在推理阶段,模型利用这些描述引发并应用规则。此设计防止了跨图像归纳信号的泄漏,使推理与感知瓶颈分离。在三个ARC风格数据集上,Mini-ARC、ACRE和Bongard-LOGO中,我们通过将两阶段管道与标准的单阶段评估进行比较,表明感知能力是观察到的性能差距的主要因素。进一步地,手动检查VL输出中的推理痕迹,发现约80%的模型错误源于感知错误。总之,这些结果表明,ARC风格的基准混合了感知和推理挑战,而观察到的性能差距可能高估了机器推理的不足。我们的发现凸显了在评估机器智能进展时,需 disentangle 感知与推理的评估协议的必要性。

关键词

引用

@article{arxiv.2512.21329,
  title  = {Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks},
  author = {Xinhe Wang and Jin Huang and Xingjian Zhang and Tianhao Wang and Jiaqi W. Ma},
  journal= {arXiv preprint arXiv:2512.21329},
  year   = {2026}
}