ViRel:基于图级类比的无监督视觉关系发现
计算机视觉与模式识别
2022-07-05 v1 人工智能
机器学习
摘要
视觉关系构成了我们理解组合世界的基础,因为视觉对象之间的关系捕捉了场景中的关键信息。从数据中自动学习关系因而具有优势,因为使用预定义标签的学习无法捕捉所有可能的关系。然而,当前的关系学习方法通常需要监督,并且并非设计用于泛化到比训练时所见关系结构更复杂的场景。在此,我们提出 ViRel,一种用于无监督发现和学习视觉关系(Visual Relations)并基于图级类比的方法。在一个任务内场景共享相同底层关系子图结构的设定下,我们通过对比同构与非同构图的图级类比学习方法,以无监督方式跨任务发现关系。一旦关系被学习,ViRel 便可通过解析预测的关系结构,为每个任务检索共享的关系图结构。使用基于网格世界(grid-world)和抽象推理语料库(Abstract Reasoning Corpus)的数据集,我们表明该方法在关系分类中达到超过 95% 的准确率,为大多数任务发现了关系图结构,并进一步泛化到具有更复杂关系结构的未见任务。
引用
@article{arxiv.2207.00590,
title = {ViRel: Unsupervised Visual Relations Discovery with Graph-level Analogy},
author = {Daniel Zeng and Tailin Wu and Jure Leskovec},
journal= {arXiv preprint arXiv:2207.00590},
year = {2022}
}
备注
ICML 2022 Beyond Bayes: Paths Towards Universal Reasoning Systems Workshop; 17 pages, 10 figures