中文

Bongard-RWR+: 基于视觉语言模型的细粒度概念真实表征

人工智能 2026-02-20 v2 计算机视觉与模式识别 机器学习

摘要

Bongard问题(BPs)提供了对抽象视觉推理(AVR)的挑战性测试基准,要求模型从仅少量示例中识别视觉概念并以自然语言描述它们。早期的BPs基准包含合成的黑白绘图,可能未完全捕捉真实场景的复杂性。后续的BPs数据集采用真实图像,尽管所表示的概念可从高层图像特征中识别,减少了任务复杂度。不同的是,最近发布的Bongard-RWR数据集旨在使用细粒度真实图像表征原始BPs中的抽象概念。其手动构建limited the dataset size to just 60 instances,限制了评估的鲁棒性。本文引入Bongard-RWR+,包含5400个实例,代表原始BPs中的抽象概念,使用视觉语言模型(VLM)管道生成真实感图像。基于Bongard-RWR,我们采用Pixtral-12B描述手动挑选的图像并生成与底层概念对齐的新描述,使用Flux.1-dev从这些描述合成图像,并手动验证生成的图像忠实于预期概念。我们在多种BPs形式上评估了最先进的视觉语言模型,包括二进制和多类分类,以及文本答案生成。我们的发现表明,尽管VLMs可以识别粗粒度视觉概念,但它们始终在辨别细粒度概念方面存在困难,凸显了其推理能力的局限性。

关键词

引用

@article{arxiv.2508.12026,
  title  = {Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems},
  author = {Szymon Pawlonka and Mikołaj Małkiński and Jacek Mańdziuk},
  journal= {arXiv preprint arXiv:2508.12026},
  year   = {2026}
}

备注

Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)