MONet:无监督场景分解与表示
计算机视觉与模式识别
2019-02-01 v1 机器学习
机器学习
摘要
以抽象构建模块对场景进行分解的能力对通用智能至关重要。当这些基本构建模块在场景间共享有意义的属性、交互及其他规律性时,此类分解可简化推理并促进对新场景的想象。特别是,以实体表示感知观测应在广泛任务上提升数据效率与迁移性能。因此,我们需要能够通过对具有此类规律性的单元进行识别并以通用格式表示,从而发现场景有用分解的模型。针对该问题,我们开发了多对象网络(MONet)。在该模型中,VAE与循环注意力网络以纯粹无监督的方式端到端联合训练,为图像区域提供注意力掩码及重建。我们表明,该模型能够学习将具有挑战性的3D场景分解为语义上有意义的组件,如物体与背景元素。
引用
@article{arxiv.1901.11390,
title = {MONet: Unsupervised Scene Decomposition and Representation},
author = {Christopher P. Burgess and Loic Matthey and Nicholas Watters and Rishabh Kabra and Irina Higgins and Matt Botvinick and Alexander Lerchner},
journal= {arXiv preprint arXiv:1901.11390},
year = {2019}
}