ADDP:基于交替去噪扩散过程学习用于图像识别与生成的通用表征
计算机视觉与模式识别
2024-04-03 v2
摘要
图像识别与生成长期相互独立发展。随着近期通用表征学习的趋势,也推动了面向识别与生成任务的通用表征的发展。然而,初步尝试主要关注生成性能,在识别任务上仍逊色。这些方法在向量量化(VQ)空间中建模,而领先的识别方法以像素作为输入。我们的关键见解有两点:(1)以像素作为输入对识别任务至关重要;(2)以VQ令牌作为重建目标对生成任务有益。这些观察促使我们提出一种交替去噪扩散过程(ADDP),将这两种空间整合到单一表征学习框架中。在每步去噪中,我们的方法首先从先前的VQ令牌解码像素,然后从解码的像素生成新的VQ令牌。扩散过程逐渐掩码掉一部分VQ令牌以构造训练样本。学习到的表征可用于生成多样的高保真图像,并在识别任务上展现出优异的迁移性能。大量实验表明,我们的方法在无条件生成、ImageNet分类、COCO检测和ADE20k分割上取得有竞争力的性能。重要的是,我们的方法代表了首个适用于生成与稠密识别任务的通用表征的成功开发。代码发布于\url{https://github.com/ChangyaoTian/ADDP}。
引用
@article{arxiv.2306.05423,
title = {ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process},
author = {Changyao Tian and Chenxin Tao and Jifeng Dai and Hao Li and Ziheng Li and Lewei Lu and Xiaogang Wang and Hongsheng Li and Gao Huang and Xizhou Zhu},
journal= {arXiv preprint arXiv:2306.05423},
year = {2024}
}
备注
Accepted by ICLR2024