无监督发现以对象为中心的神经场
计算机视觉与模式识别
2025-02-18 v2
摘要
我们研究从单张图像推断以对象为中心的3D场景表示。尽管最近的方法在从简单合成图像中进行无监督3D对象发现方面显示出潜力,但它们无法泛化到具有视觉丰富且多样对象的真实世界场景。这一局限性源于它们的对象表示,这些表示将对象的固有属性(如形状和外观)与外在的、以观察者为中心的属性(如它们的3D位置)纠缠在一起。为了解决这一瓶颈,我们提出了无监督发现以对象为中心的神经场(uOCF)。uOCF专注于学习对象的内在属性,并对外在属性进行单独建模。我们的方法显著提高了系统泛化能力,从而能够从稀疏的真实世界图像中无监督学习高保真度的以对象为中心的场景表示。为了评估我们的方法,我们收集了三个新的数据集,包括两个真实的厨房环境。大量实验表明,uOCF能够从单张真实图像中无监督发现视觉丰富的对象,从而实现3D对象分割和场景操作等应用。值得注意的是,uOCF展示了从单张真实图像中对未见过的对象进行零样本泛化的能力。项目页面:https://red-fairy.github.io/uOCF/
引用
@article{arxiv.2402.07376,
title = {Unsupervised Discovery of Object-Centric Neural Fields},
author = {Rundong Luo and Hong-Xing Yu and Jiajun Wu},
journal= {arXiv preprint arXiv:2402.07376},
year = {2025}
}
备注
TMLR 2025