Bongard-HOI:面向人-物交互少样本视觉推理的基准
计算机视觉与模式识别
2023-04-14 v2 人工智能
机器学习
摘要
当今的视觉模式识别模型与人类水平的视觉认知之间仍存在显著差距,尤其是在新颖概念的少样本学习和组合推理方面。我们提出 Bongard-HOI,一个新的视觉推理基准,聚焦于从自然图像中组合学习人-物交互(HOIs)。它受经典 Bongard 问题(BPs)的两个理想特性启发:1)少样本概念学习,和 2)上下文依赖推理。我们精心策划带有困难负样本的少样本实例,其中正类和负类图像仅在动作标签上不同,使得仅识别物体类别不足以完成我们的基准。我们还设计了多个测试集来系统研究视觉学习模型的泛化能力,在其中我们改变少样本实例的训练集与测试集之间 HOI 概念的重叠度,从部分重叠到无重叠。Bongard-HOI 对当今的视觉识别模型提出了重大挑战。最先进的 HOI 检测模型在少样本二分类预测上仅达到 62% 准确率,而 MTurk 上的业余人类测试者却有 91% 准确率。借助 Bongard-HOI 基准,我们希望进一步推进视觉推理的研究努力,特别是在整体感知-推理系统和更好的表示学习方面。
引用
@article{arxiv.2205.13803,
title = {Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions},
author = {Huaizu Jiang and Xiaojian Ma and Weili Nie and Zhiding Yu and Yuke Zhu and Song-Chun Zhu and Anima Anandkumar},
journal= {arXiv preprint arXiv:2205.13803},
year = {2023}
}
备注
CVPR 2022 (oral); First two authors contributed equally; Code: https://github.com/NVlabs/Bongard-HOI