将扩散模型作为掩码自编码器
计算机视觉与模式识别
2023-04-07 v1
摘要
长期以来,人们一直认为生成可以促进对视觉数据的真正理解。与此一致,鉴于近期对去噪扩散模型的兴趣,我们重新审视了生成式预训练视觉表示。虽然直接使用扩散模型进行预训练不能产生强大的表示,但我们以掩码输入为条件对扩散模型进行约束,并将扩散模型表述为掩码自编码器 (DiffMAE)。我们的方法能够 (i) 作为下游识别任务的强大初始化,(ii) 进行高质量图像修复,以及 (iii) 轻松扩展到视频,并在视频上产生最先进的分类准确率。我们进一步对设计选择的优缺点进行了全面研究,并建立了扩散模型与掩码自编码器之间的联系。
引用
@article{arxiv.2304.03283,
title = {Diffusion Models as Masked Autoencoders},
author = {Chen Wei and Karttikeya Mangalam and Po-Yao Huang and Yanghao Li and Haoqi Fan and Hu Xu and Huiyu Wang and Cihang Xie and Alan Yuille and Christoph Feichtenhofer},
journal= {arXiv preprint arXiv:2304.03283},
year = {2023}
}
备注
Tech report. Project page: https://weichen582.github.io/diffmae.html