Bongard-RWR+: 基于视觉语言模型的细粒度概念真实表征
人工智能
2026-02-20 v2 计算机视觉与模式识别
机器学习
摘要
Bongard问题(BPs)提供了对抽象视觉推理(AVR)的挑战性测试基准,要求模型从仅少量示例中识别视觉概念并以自然语言描述它们。早期的BPs基准包含合成的黑白绘图,可能未完全捕捉真实场景的复杂性。后续的BPs数据集采用真实图像,尽管所表示的概念可从高层图像特征中识别,减少了任务复杂度。不同的是,最近发布的Bongard-RWR数据集旨在使用细粒度真实图像表征原始BPs中的抽象概念。其手动构建limited the dataset size to just 60 instances,限制了评估的鲁棒性。本文引入Bongard-RWR+,包含5400个实例,代表原始BPs中的抽象概念,使用视觉语言模型(VLM)管道生成真实感图像。基于Bongard-RWR,我们采用Pixtral-12B描述手动挑选的图像并生成与底层概念对齐的新描述,使用Flux.1-dev从这些描述合成图像,并手动验证生成的图像忠实于预期概念。我们在多种BPs形式上评估了最先进的视觉语言模型,包括二进制和多类分类,以及文本答案生成。我们的发现表明,尽管VLMs可以识别粗粒度视觉概念,但它们始终在辨别细粒度概念方面存在困难,凸显了其推理能力的局限性。
引用
@article{arxiv.2508.12026,
title = {Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems},
author = {Szymon Pawlonka and Mikołaj Małkiński and Jacek Mańdziuk},
journal= {arXiv preprint arXiv:2508.12026},
year = {2026}
}
备注
Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)