视频序列无监督目标表征基准评测
计算机视觉与模式识别
2021-08-18 v2
摘要
以目标为单位感知世界并随时间追踪它们是推理与场景理解的关键前提。近来,已有若干用于无监督学习目标中心表征的方法被提出。然而,由于这些模型在不同下游任务上评估,它们在检测、前景-背景分割及目标追踪等基本感知能力上的比较仍不明确。为弥补此缺口,我们设计了一个包含四个复杂度各异的数据集及七个额外测试集的基准,后者涵盖与自然视频相关的极具挑战的追踪场景。利用该基准,我们比较了四种目标中心方法:基于循环空间注意力的ViMON(MONet的视频扩展)、通过空间混合模型聚类的OP3,以及利用空间变换器显式分解的TBA和SCALOR。结果表明,具有无约束潜表征的架构在目标检测、分割与追踪方面学到了比基于空间变换器的架构更强大的表征。我们还观察到,尽管这些测试场景为合成性质,现有方法均无法从容应对最具挑战的追踪场景,这表明我们的基准可为学习更鲁棒的目标中心视频表征提供有益指导。
引用
@article{arxiv.2006.07034,
title = {Benchmarking Unsupervised Object Representations for Video Sequences},
author = {Marissa A. Weis and Kashyap Chitta and Yash Sharma and Wieland Brendel and Matthias Bethge and Andreas Geiger and Alexander S. Ecker},
journal= {arXiv preprint arXiv:2006.07034},
year = {2021}
}