中文

Bongards 在感知与推理边界:程序还是语言?

计算机视觉与模式识别 2026-02-04 v1 人工智能

摘要

视觉语言模型(VLM)在日常视觉任务中取得显著进展,如为自然图像生成描述或回答关于此类图像的常识问题。但人类拥有在根本性新情境中部署视觉推理能力的 puzzling 能力,这一技能由经典的视觉推理挑战Bongard问题严格测试。我们提出一种神经符号方法来解决这些问题:给定Bongard问题的假设解规则,利用LLM生成该规则的参数化程序表示,并通过贝叶斯优化进行参数拟合。我们在给定ground truth规则的图像分类任务中评估了该方法,以及从头开始解决问题的能力。

关键词

引用

@article{arxiv.2602.03038,
  title  = {Bongards at the Boundary of Perception and Reasoning: Programs or Language?},
  author = {Cassidy Langenfeld and Claas Beger and Gloria Geng and Wasu Top Piriyakulkij and Keya Hu and Yewen Pu and Kevin Ellis},
  journal= {arXiv preprint arXiv:2602.03038},
  year   = {2026}
}

备注

6 pages, 5 figures