符号 grounding 揭示抽象视觉推理中的表征瓶颈
人工智能
2026-04-24 v1 计算与语言
计算机视觉与模式识别
摘要
视觉-语言模型(VLM)常在抽象视觉推理基准测试如Bongard问题上失败,引发关于主要瓶颈是否在推理还是表征的疑问。我们在Bongard-LOGO上进行研究,该基准以具有真实生成程序的抽象概念学习为主,通过比较原始图像上的端到端VLM与给定符号输入的大型语言模型(LLM)。将符号输入作为诊断探针而非实用多模态架构,我们的Componential--Grammatical(C--G)范式将Bongard-LOGO重新表述为基于LOGO风格动作程序或结构化描述的符号推理任务。LLM取得大幅稳定性提升,在Free-form问题上达到九十分之几的准确率,而强视觉基线在匹配的任务定义下仍接近随机水平。对输入格式、显式概念提示及最小视觉 grounding的消融实验表明,这些因素的影响远小于从像素转向符号结构的变化。这些结果表明表征是抽象视觉推理的关键瓶颈,并展示了符号输入如何作为受控诊断上限发挥作用。
关键词
引用
@article{arxiv.2604.21346,
title = {Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning},
author = {Mohit Vaishnav and Tanel Tammet},
journal= {arXiv preprint arXiv:2604.21346},
year = {2026}
}