中文

用于抽象推理的神经亲和力框架:通过程序化任务分类诊断Transformer架构中的组合差距

人工智能 2025-12-09 v1 计算与语言 机器学习

摘要

回应 Hodel 等人(2024)关于在 re-arc 中对任务相关性进行形式化定义的呼吁,我们提出了首个涵盖全部 400 个任务的 9 类别分类体系,并通过基于规则的代码分析以 97.5% 的准确率进行了验证。我们通过训练一个 CNN 处理原始网格像素(S3 上准确率为 95.24%,整体准确率为 36.25%,为随机猜测的 3.3 倍)证明了该分类体系的视觉一致性,随后将其诊断性地应用于原始 ARC-AGI-2 测试集。我们的课程分析显示 35.3% 的任务对 Transformer 表现出低神经亲和力——这是一种反映 ARC-AGI-2 的分布偏差。为探究这种不匹配,我们在 302 个任务上微调了一个 1.7M 参数的 Transformer,揭示了一个深刻的组合差距:302 个任务中有 210 个(69.5%)在细胞准确率(局部模式)上达到 >80%,但在网格准确率(全局综合)上低于 10%。这提供了神经亲和力天花板效应的直接证据,即性能受限于架构适用性而非课程。将我们的框架应用于 Li 等人独立的 ViTARC 研究(400 个专家模型,每个 1M 个样本)证实了其预测能力:极低亲和力任务达到 51.9%,而高亲和力任务达到 77.7%(p<0.001),其中一个任务即使拥有海量数据也达到 0%。该分类体系使得精确诊断成为可能:低亲和力任务(A2)遭遇硬天花板,而高亲和力任务(C1)达到 99.8%。这些结果表明进展需要具有亲和力对齐模块的混合架构。我们发布了经过验证的分类体系。

关键词

引用

@article{arxiv.2512.07109,
  title  = {A Neural Affinity Framework for Abstract Reasoning: Diagnosing the Compositional Gap in Transformer Architectures via Procedural Task Taxonomy},
  author = {Miguel Ingram and Arthur Joseph Merritt},
  journal= {arXiv preprint arXiv:2512.07109},
  year   = {2025}
}

备注

62 pages, 10 figures