中文

模态如何塑造感知与推理:ARC-AGI中错误传播的研究

人工智能 2025-11-21 v1 计算机视觉与模式识别 多智能体系统

摘要

ARC-AGI和ARC-AGI-2衡量在小型颜色量化网格上的通过组合的泛化能力,其奖项竞赛使对这些更难的hold-out任务的进展成为系统综合泛化的有意义代理。最近的指令优先系统将网格转换为简洁的自然语言或DSL规则,在generate-execute-select循环中执行,但我们缺乏对编码如何塑造模型感知以及如何分离指令错误与执行错误的原则性解释。我们假设模态施加了感知瓶颈——文本将2D结构平坦化为1D标记,而图像保留布局但可能引入patch-size别名,因而塑造了哪些网格特征被可靠感知。为测试这一假设,我们在九种文本和图像模态中隔离感知与推理,使用加权集合不一致度量和两个阶段的推理管道,发现结构化文本在稀疏特征上获得精确坐标,图像捕捉2D形状但对分辨率敏感,两者结合可提升执行性能(约8个感知点;约0.20的中位数相似度)。总体而言,与Transformer归纳偏置对齐,并通过文本和图像之间的交叉验证实现更准确的指令和更可靠的执行,而无需改变底层模型。

关键词

引用

@article{arxiv.2511.15717,
  title  = {How Modality Shapes Perception and Reasoning: A Study of Error Propagation in ARC-AGI},
  author = {Bo Wen and Chen Wang and Erhan Bilal},
  journal= {arXiv preprint arXiv:2511.15717},
  year   = {2025}
}