中文

SlotDiffusion:基于扩散模型的对象中心生成建模

计算机视觉与模式识别 2023-09-25 v2 机器学习

摘要

对象中心学习旨在用一组对象实体(又称 slots)表示视觉数据,提供能够实现系统性泛化的结构化表示。借助 Transformer 等先进架构,近期方法在无监督对象发现方面取得了显著进展。此外,基于 slot 的表示在生成建模方面具有巨大潜力,例如可控图像生成和图像编辑中的对象操控。然而,当前基于 slot 的方法常产生模糊图像和失真对象,表现出较差的生成建模能力。本文中,我们聚焦于改进 slot 到图像的解码——这是高质量视觉生成的关键方面。我们引入了 SlotDiffusion——一种面向图像和视频数据的对象中心潜扩散模型(LDM)。得益于 LDM 强大的建模能力,SlotDiffusion 在六个数据集上的无监督对象分割和视觉生成方面超越了以往的 slot 模型。此外,我们学习的对象特征可被现有的对象中心动力学模型所利用,提升视频预测质量和下游时序推理任务。最后,我们展示了当与自监督预训练图像编码器集成时,SlotDiffusion 可扩展至 PASCAL VOC 和 COCO 等无约束真实世界数据集。

关键词

引用

@article{arxiv.2305.11281,
  title  = {SlotDiffusion: Object-Centric Generative Modeling with Diffusion Models},
  author = {Ziyi Wu and Jingyu Hu and Wuyue Lu and Igor Gilitschenski and Animesh Garg},
  journal= {arXiv preprint arXiv:2305.11281},
  year   = {2023}
}

备注

NeurIPS 2023 Spotlight. Project page: https://slotdiffusion.github.io/