通过集合对比学习以对象为中心的视频模型
计算机视觉与模式识别
2020-11-23 v1 机器学习
摘要
对比式自监督对象表示学习最近作为基于重建的训练的一种有吸引力的替代方案而出现。先前的方法侧重于将单个对象表示(槽位)相互对比。然而,这种方法的一个基本问题是,总体对比损失对于(i)在每个槽位中表示不同对象,与对于(ii)在所有槽位中(重新)表示同一对象是相同的。因此,该目标本身并不推动槽位中对象中心表示的出现。我们通过引入一个全局的、基于集合的对比损失来解决此问题:不是将单个槽位表示相互对比,而是聚合这些表示并将联合起来的集合相互对比。此外,我们将基于注意力的编码器引入此对比框架,简化了训练并提供了可解释的对象掩码。我们在两个合成视频数据集上的结果表明,该方法在重建、未来预测和对象分离性能方面优于先前的对比方法。
引用
@article{arxiv.2011.10287,
title = {Learning Object-Centric Video Models by Contrasting Sets},
author = {Sindy Löwe and Klaus Greff and Rico Jonschkowski and Alexey Dosovitskiy and Thomas Kipf},
journal= {arXiv preprint arXiv:2011.10287},
year = {2020}
}
备注
NeurIPS 2020 Workshop on Object Representations for Learning and Reasoning