中文

揭示视觉关系推理的几何结构

神经元与认知 2025-07-28 v2 计算机视觉与模式识别

摘要

人类能够轻松泛化抽象关系,例如识别形状或颜色上的“恒定”,而神经网络在此方面存在困难,这限制了其灵活推理能力。为了研究这种泛化背后的机制,我们引入了 SimplifiedRPM,这是一个用于系统评估抽象关系推理的新基准,解决了先前数据集的局限性。同时,我们进行了人类实验以量化关系难度,从而实现模型与人类的直接比较。通过测试 ResNet-50、Vision Transformer、Wild Relation Network 和 Scattering Compositional Learner (SCL) 四种模型,我们发现 SCL 的泛化能力最好,且与人类行为最为契合。利用几何方法,我们识别了能够准确预测泛化的关键表示属性,并揭示了信号与维度之间的基本权衡:新关系被压缩到训练诱导的子空间中。逐层分析揭示了关系结构出现的位置,突出了瓶颈,并提出了关于大脑中抽象推理的具体假设。受这些见解启发,我们提出了 SNRloss,这是一种明确平衡表示几何的新目标。我们的结果为关系推理奠定了几何基础,为 AI 中更具人类特征的视觉推理铺平了道路,并为将几何分析扩展到更广泛的认知任务开辟了有前景的途径。

关键词

引用

@article{arxiv.2502.17382,
  title  = {Unraveling the geometry of visual relational reasoning},
  author = {Jiaqi Shang and Gabriel Kreiman and Haim Sompolinsky},
  journal= {arXiv preprint arXiv:2502.17382},
  year   = {2025}
}

备注

27 pages, 7 figures, 8 SI figures, 2 SI tables