面向复杂自然视频的简单无监督以对象为中心学习
计算机视觉与模式识别
2022-05-30 v1 机器学习
摘要
无监督以对象为中心学习旨在将场景的模块化、组合性和因果结构表示为一组对象表示,从而有望解决传统单向量表示(如系统性泛化能力差)的诸多关键局限。尽管近年来取得了许多显著进展,该方向最关键的问题之一是此前方法仅适用于简单合成场景,而无法处理复杂自然图像或视频。本文提出 STEVE,一种用于视频中以对象为中心学习的无监督模型。我们所提模型通过证明其在各类复杂自然视频上的有效性实现了重大进展,这在此前研究中前所未有。有趣的是,这一成果既未通过增加模型架构复杂度,也未引入新目标或弱监督来实现,而是通过一个出人意料地简单的架构实现:该架构使用基于 transformer 的图像解码器并以 slots 为条件,学习目标仅仅是重建观测。我们在各类复杂自然视频上的实验结果表明,相较于先前的最先进方法取得了显著改进。
引用
@article{arxiv.2205.14065,
title = {Simple Unsupervised Object-Centric Learning for Complex and Naturalistic Videos},
author = {Gautam Singh and Yi-Fu Wu and Sungjin Ahn},
journal= {arXiv preprint arXiv:2205.14065},
year = {2022}
}