中文

用于视频分解与预测的对象中心表示的时间条件生成建模

计算机视觉与模式识别 2023-10-27 v4 机器学习

摘要

当从多个视角感知世界时,人类能够以组合方式推理完整对象,即使某对象从某些视角完全被遮挡。同时,人类能在观察多个视角后想象新视角。多视角对象中心学习的近期显著进展仍留下一些未解决问题:1)部分或完全被遮挡对象的形状不能很好重建。2)新视角预测依赖于昂贵的视角标注而非视图表示中的隐式规则。本文中,我们引入一种用于视频的时间条件生成模型。为准确重建对象的完整形状,我们增强了对象与视角的潜表示之间的解耦,其中时间条件视角的潜表示由 Transformer 联合推断,然后输入到 Slot Attention 的序列扩展以学习对象中心表示。此外,采用高斯过程作为视角潜变量的先验,用于无视角标注的视频生成与新视角预测。在多个数据集上的实验表明,所提模型能进行对象中心视频分解、重建被遮挡对象的完整形状并做出新视角预测。

关键词

引用

@article{arxiv.2301.08951,
  title  = {Time-Conditioned Generative Modeling of Object-Centric Representations for Video Decomposition and Prediction},
  author = {Chengmin Gao and Bin Li},
  journal= {arXiv preprint arXiv:2301.08951},
  year   = {2023}
}