中文

DDLP:基于深度动态隐粒子以无监督方式实现以对象为中心的视频预测

计算机视觉与模式识别 2024-02-09 v2 机器学习

摘要

我们提出了一种基于深度隐粒子(DLP)表示的新型以对象为中心的视频预测算法。与现有的基于槽(slot)或块(patch)的表示相比,DLP 使用一组具有位置、大小等可学习参数的关键点对场景建模,既高效又可解释。我们的方法,即深度动态隐粒子(DDLP),在多个具有挑战性的数据集上取得了最先进的以对象为中心的视频预测结果。DDLP 的可解释性使我们能够执行“假设(what-if)”生成——预测初始帧中改变对象属性所带来的后果,而 DLP 的紧凑结构支持基于扩散的高效无条件视频生成。视频、代码及预训练模型见:https://taldatech.github.io/ddlp-web

关键词

引用

@article{arxiv.2306.05957,
  title  = {DDLP: Unsupervised Object-Centric Video Prediction with Deep Dynamic Latent Particles},
  author = {Tal Daniel and Aviv Tamar},
  journal= {arXiv preprint arXiv:2306.05957},
  year   = {2024}
}

备注

TMLR 2024. Project site: https://taldatech.github.io/ddlp-web