中文

SODA:用于表征学习的瓶颈扩散模型

计算机视觉与模式识别 2023-11-30 v1 人工智能 机器学习

摘要

我们介绍 SODA,一种专为表征学习设计的自监督扩散模型。该模型包含一个图像编码器,将源视图蒸馏为紧凑表征,进而引导相关新视图的生成。我们表明,通过在编码器与去噪解码器之间施加紧凑瓶颈,并利用新视图合成作为自监督目标,我们能够将扩散模型转变为强大的表征学习器,以无监督方式捕获视觉语义。据我们所知,SODA 是首个在 ImageNet 线性探测分类上取得成功的扩散模型,同时它还在广泛的数据集上完成重建、编辑与合成任务。进一步研究揭示了其涌现潜空间的解耦特性,可作为控制和操纵模型所生成图像的有效接口。总而言之,我们旨在阐明扩散模型令人兴奋且前景广阔的潜力,不仅用于图像生成,也用于学习丰富而鲁棒的表征。

关键词

引用

@article{arxiv.2311.17901,
  title  = {SODA: Bottleneck Diffusion Models for Representation Learning},
  author = {Drew A. Hudson and Daniel Zoran and Mateusz Malinowski and Andrew K. Lampinen and Andrew Jaegle and James L. McClelland and Loic Matthey and Felix Hill and Alexander Lerchner},
  journal= {arXiv preprint arXiv:2311.17901},
  year   = {2023}
}