文本到图像扩散模型是零样本分类器
计算机视觉与模式识别
2023-09-07 v2 人工智能
机器学习
摘要
文本到图像扩散模型卓越的生成能力表明其学习了图像-文本信息的丰富表示。然而,其表示所捕获的知识尚未被充分理解,且尚未在下游任务中被深入探索。我们通过提出一种将其作为零样本分类器进行评估的方法来研究扩散模型。核心思想是利用扩散模型在给定标签文本描述下对加噪图像去噪的能力,作为该标签似然的代理。我们将方法应用于 Stable Diffusion 与 Imagen,用以探查模型知识的细粒度方面,并与 CLIP 的零样本能力比较。它们在广泛的零样本图像分类数据集上与 CLIP 表现相当。此外,它们在形状/纹理偏置测试中取得最先进结果,并能成功执行属性绑定而 CLIP 不能。尽管生成式预训练在 NLP 中已很普遍,视觉基础模型常使用其他方法如对比学习。基于我们的发现,我们认为生成式预训练应被探索作为视觉-语言任务的一个引人注目的替代方案。
引用
@article{arxiv.2303.15233,
title = {Text-to-Image Diffusion Models are Zero-Shot Classifiers},
author = {Kevin Clark and Priyank Jaini},
journal= {arXiv preprint arXiv:2303.15233},
year = {2023}
}