视觉语言模型能否稳健推理?一项神经符号研究
机器学习
2026-03-26 v1 人工智能
计算机视觉与模式识别
摘要
视觉语言模型(VLM)已被应用于广泛的推理任务,但它们在分布偏移下能否稳健推理仍不清楚。在本文中,我们研究协变量偏移,即感知输入分布发生变化而底层预测规则不变的情况。为了研究这个问题,我们考虑了视觉演绎推理任务,其中模型需要根据图像和定义在图像中对象概念上的逻辑规则来回答查询。经验上,我们发现通过基于梯度的端到端训练微调的VLM可以实现较高的分布内准确性,但在这种偏移下无法泛化,这表明微调并不能可靠地诱导底层推理功能。这促使我们从神经符号的角度将感知与推理解耦。然而,我们进一步观察到,最近依赖黑盒组件进行推理的神经符号方法在不同任务上仍可能表现出不一致的稳健性。为了解决这个问题,我们提出了VLC,一种结合基于VLM的概念识别与基于电路的符号推理的神经符号方法。特别是,任务规则被编译成符号程序,即电路,该电路在VLM识别的对象概念上精确执行规则。在三个具有不同规则集的视觉演绎推理任务上的实验表明,VLC在协变量偏移下始终表现出强大的性能,突显了其支持稳健推理的能力。
引用
@article{arxiv.2603.23867,
title = {Can VLMs Reason Robustly? A Neuro-Symbolic Investigation},
author = {Weixin Chen and Antonio Vergari and Han Zhao},
journal= {arXiv preprint arXiv:2603.23867},
year = {2026}
}