Bongards 在感知与推理边界:程序还是语言?
计算机视觉与模式识别
2026-02-04 v1 人工智能
摘要
视觉语言模型(VLM)在日常视觉任务中取得显著进展,如为自然图像生成描述或回答关于此类图像的常识问题。但人类拥有在根本性新情境中部署视觉推理能力的 puzzling 能力,这一技能由经典的视觉推理挑战Bongard问题严格测试。我们提出一种神经符号方法来解决这些问题:给定Bongard问题的假设解规则,利用LLM生成该规则的参数化程序表示,并通过贝叶斯优化进行参数拟合。我们在给定ground truth规则的图像分类任务中评估了该方法,以及从头开始解决问题的能力。
关键词
引用
@article{arxiv.2602.03038,
title = {Bongards at the Boundary of Perception and Reasoning: Programs or Language?},
author = {Cassidy Langenfeld and Claas Beger and Gloria Geng and Wasu Top Piriyakulkij and Keya Hu and Yewen Pu and Kevin Ellis},
journal= {arXiv preprint arXiv:2602.03038},
year = {2026}
}
备注
6 pages, 5 figures