中文

SAVi++:面向真实世界视频的端到端以对象为中心学习

计算机视觉与模式识别 2022-12-26 v2 机器学习

摘要

视觉世界可简洁地描述为具有稀疏交互的不同实体。除非提供显式的实例级监督,否则端到端计算机视觉方法在动态视觉场景中发掘这种组合结构一直具有挑战性。利用运动线索的基于槽(slot)的模型最近在学习无直接监督地表示、分割和跟踪对象方面展现出巨大前景,但它们仍无法扩展到复杂的真实世界多对象视频。为弥合此差距,我们从人类发展中获得启发,并假设以深度信号形式存在的场景几何信息可促进以对象为中心的学习。我们引入 SAVi++,一种以对象为中心的视频模型,其被训练为从基于槽的视频表示中预测深度信号。通过进一步利用模型缩放的最佳实践,我们能够训练 SAVi++ 来分割由移动相机记录的复杂动态场景,这些场景包含自然背景上外观多样且静态与移动对象并存,而无需分割监督。最后,我们证明通过使用从 LiDAR 获得的稀疏深度信号,SAVi++ 能够从真实世界 Waymo Open 数据集中的视频学习涌现的对象分割与跟踪。

关键词

引用

@article{arxiv.2206.07764,
  title  = {SAVi++: Towards End-to-End Object-Centric Learning from Real-World Videos},
  author = {Gamaleldin F. Elsayed and Aravindh Mahendran and Sjoerd van Steenkiste and Klaus Greff and Michael C. Mozer and Thomas Kipf},
  journal= {arXiv preprint arXiv:2206.07764},
  year   = {2022}
}

备注

Project page at https://slot-attention-video.github.io/savi++/