去噪扩散自编码器是统一的自监督学习器
计算机视觉与模式识别
2023-08-22 v2 机器学习
摘要
受近期扩散模型(其类似于去噪自编码器)进展的启发,我们探究它们能否通过生成式预训练为分类获取判别性表示。本文表明,扩散模型中的网络,即去噪扩散自编码器(DDAE),是统一的自监督学习器:通过对无条件图像生成进行预训练,DDAE 已在其中间层内学到强线性可分表示,无需辅助编码器,从而使扩散预训练成为一种生成与判别双重学习的通用方法。为验证这一点,我们进行了线性探测与微调评估。我们的基于扩散的方法在 CIFAR-10 与 Tiny-ImageNet 上分别取得 95.9% 与 50.0% 的线性评估准确率,并首次可与对比学习与掩码自编码器相媲美。来自 ImageNet 的迁移学习也证实了 DDAE 对 Vision Transformers 的适用性,暗示了将 DDAE 扩展为统一基础模型的潜力。代码见 github.com/FutureXiang/ddae。
引用
@article{arxiv.2303.09769,
title = {Denoising Diffusion Autoencoders are Unified Self-supervised Learners},
author = {Weilai Xiang and Hongyu Yang and Di Huang and Yunhong Wang},
journal= {arXiv preprint arXiv:2303.09769},
year = {2023}
}
备注
ICCV 2023 Oral