中文

Bongard-OpenWorld:面向真实世界中自由形式视觉概念的少样本推理

机器学习 2025-01-08 v6

摘要

我们提出了 Bongard-OpenWorld,一个用于评估机器视觉在真实世界中少样本推理能力的新基准。它源自经典的 Bongard 问题(BPs):给定两组图像(正样本与负样本),模型需要通过归纳仅由正样本图像所刻画的视觉概念,来识别查询图像所属的集合。我们的基准继承了原始 BPs 的少样本概念归纳特性,同时增加了两个新颖的挑战层面:1)开放世界自由形式概念,因为 Bongard-OpenWorld 中的视觉概念来自开放词表的术语的独特组合,涵盖物体类别、抽象视觉属性以及常识事实知识;2)真实世界图像,而非许多同类工作所使用的合成示意图。在我们的探索中,Bongard-OpenWorld 已对当前少样本推理算法构成了显著挑战。我们进一步研究了近期提出的大语言模型(LLMs)与视觉-语言模型(VLMs)在多大程度上能解决我们的任务,包括直接探查 VLMs,以及将 VLMs 与 LLMs 以交互式推理方案相结合。我们甚至构想了一种神经符号推理方法,将 LLMs 与 VLMs 同逻辑推理相调和,以模拟人类解决 Bongard 问题的过程。然而,这些方法中无一能弥合人机差距,因为最佳学习器仅达到 64% 准确率,而人类参与者轻松达到 91%。我们希望 Bongard-OpenWorld 能帮助我们更好地理解当前视觉智能的局限,并推动未来关于具备更强少样本视觉推理能力的视觉智能体的研究。

关键词

引用

@article{arxiv.2310.10207,
  title  = {Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real World},
  author = {Rujie Wu and Xiaojian Ma and Zhenliang Zhang and Wei Wang and Qing Li and Song-Chun Zhu and Yizhou Wang},
  journal= {arXiv preprint arXiv:2310.10207},
  year   = {2025}
}

备注

Accepted to ICLR 2024