支撑集上下文对 Bongard 问题至关重要
计算机视觉与模式识别
2024-12-03 v2 人工智能
机器学习
摘要
当前的机器学习方法难以解决 Bongard 问题,这是一种智商测试,要求从一组正类和负类“支撑”图像中推导出抽象的“概念”,然后分类新查询图像是否描绘了该关键概念。在面向自然图像 Bongard 问题的基准 Bongard-HOI 上,大多数现有方法的准确率最高仅达 69%(随机水平为 50%)。低准确率常被归因于神经网络缺乏寻找类人符号规则的能力。在本工作中,我们指出许多现有方法因一个更简单的问题而损失了准确率:它们未根据支撑集整体所含信息来调整图像特征,而是依赖从单个支撑样本中提取的信息。这是一个关键问题,因为典型 Bongard 问题中的“关键概念”往往只能借助多个正类和多个负类来区分。我们探索了纳入该上下文的简单方法,并展示出相较先前工作的显著提升,在采用同等视觉骨干架构的方法中,于 Bongard-LOGO(75.3%)和 Bongard-HOI(76.4%)上取得新的 SOTA 准确率,并在原始 Bongard 问题集上表现强劲(60.8%)。
引用
@article{arxiv.2309.03468,
title = {Support-Set Context Matters for Bongard Problems},
author = {Nikhil Raghuraman and Adam W. Harley and Leonidas Guibas},
journal= {arXiv preprint arXiv:2309.03468},
year = {2024}
}
备注
TMLR October 2024. Code: https://github.com/nraghuraman/bongard-context