基于生成式时空分解的以对象为中心的表示学习
机器学习
2021-11-11 v1 计算机视觉与模式识别
摘要
学习以对象为中心的场景表示对于获得对复杂场景的结构性理解与抽象至关重要。然而,由于当前无监督以对象为中心的表示学习方法或建立在静止观察者假设、或建立在静态场景假设之上,它们常面临:i)单视图空间歧义,或 ii)从动态场景中错误或不准确地推断对象表示。为此,我们提出动态感知多对象网络(DyMON),一种将多视图以对象为中心的表示学习拓展至动态场景的方法。我们在多视图动态场景数据上训练 DyMON,并表明 DyMON 可在无监督下从观测序列中分解观察者运动与场景对象动态的纠缠效应,并构建适用于任意时刻(跨时间查询)与任意视角(跨空间查询)渲染的场景对象空间表示。我们还表明,这种分解后的场景表示(关于对象)支持按空间与时间独立地查询单个对象。
引用
@article{arxiv.2111.05393,
title = {Object-Centric Representation Learning with Generative Spatial-Temporal Factorization},
author = {Li Nanbo and Muhammad Ahmed Raza and Hu Wenbin and Zhaole Sun and Robert B. Fisher},
journal= {arXiv preprint arXiv:2111.05393},
year = {2021}
}
备注
Accepted at NeurIPS 2021