Visual Jenga:通过反事实填充发现对象依赖关系
计算机视觉与模式识别
2025-03-28 v1
摘要
本文提出了一种新颖的场景理解任务,称为 Visual Jenga。灵感来自游戏 Jenga,所提出的任务涉及逐步从单张图像中移除对象,直至仅剩背景。正如 Jenga 玩家必须理解结构依赖才能维持塔的稳定性一样,我们的任务通过系统性地探索在物理和几何意义上哪些对象可以被移除而保持场景连贯性,从而揭示场景元素之间的内在关系。作为解决 Visual Jenga 任务的起点,我们提出一种简单、数据驱动且无需训练的方法,在实际图像上效果出色。我们方法的原理是利用场景中对象之间两两关系的非对称性,并使用大型填充模型生成一组反事实,从而量化这种非对称性。
关键词
引用
@article{arxiv.2503.21770,
title = {Visual Jenga: Discovering Object Dependencies via Counterfactual Inpainting},
author = {Anand Bhattad and Konpat Preechakul and Alexei A. Efros},
journal= {arXiv preprint arXiv:2503.21770},
year = {2025}
}
备注
project page: https://visualjenga.github.io/