SlotDiffusion:基于扩散模型的对象中心生成建模
计算机视觉与模式识别
2023-09-25 v2 机器学习
摘要
对象中心学习旨在用一组对象实体(又称 slots)表示视觉数据,提供能够实现系统性泛化的结构化表示。借助 Transformer 等先进架构,近期方法在无监督对象发现方面取得了显著进展。此外,基于 slot 的表示在生成建模方面具有巨大潜力,例如可控图像生成和图像编辑中的对象操控。然而,当前基于 slot 的方法常产生模糊图像和失真对象,表现出较差的生成建模能力。本文中,我们聚焦于改进 slot 到图像的解码——这是高质量视觉生成的关键方面。我们引入了 SlotDiffusion——一种面向图像和视频数据的对象中心潜扩散模型(LDM)。得益于 LDM 强大的建模能力,SlotDiffusion 在六个数据集上的无监督对象分割和视觉生成方面超越了以往的 slot 模型。此外,我们学习的对象特征可被现有的对象中心动力学模型所利用,提升视频预测质量和下游时序推理任务。最后,我们展示了当与自监督预训练图像编码器集成时,SlotDiffusion 可扩展至 PASCAL VOC 和 COCO 等无约束真实世界数据集。
引用
@article{arxiv.2305.11281,
title = {SlotDiffusion: Object-Centric Generative Modeling with Diffusion Models},
author = {Ziyi Wu and Jingyu Hu and Wuyue Lu and Igor Gilitschenski and Animesh Garg},
journal= {arXiv preprint arXiv:2305.11281},
year = {2023}
}
备注
NeurIPS 2023 Spotlight. Project page: https://slotdiffusion.github.io/