中文

利用扩散先验统一生成式与判别式模型以实现统一视觉感知

计算机视觉与模式识别 2024-01-31 v1

摘要

扩散模型在图像生成方面展现出惊人的能力,推动了将其应用拓展至生成任务之外的努力。然而,一个持续存在的挑战是缺乏统一的方法将扩散模型应用于语义粒度要求多样的视觉感知任务。我们的目标是建立一个统一的视觉感知框架,充分发挥生成式与判别式模型之间潜在的协同作用。在本文中,我们提出Vermouth,一个简单而有效的框架,包含预训练的Stable Diffusion(SD)模型(拥有丰富的生成先验),一个集成层次表示的统一头部(U-head),以及一个提供判别性先验的专家。全面调查揭示了Vermouth的若干特征,如不同时间步中潜变量以及各U-net阶段隐藏的感知粒度差异。我们强调,不必引入重量级或复杂的解码器即可将扩散模型转化为强大的表示学习器。广泛的对比评估表明,我们的方法在零样本手绘风格图像检索(ZS-SBIR)、少样本分类和开放词汇语义分割任务上均表现出色。令人鼓舞的结果表明,扩散模型作为强大的学习器具有巨大的潜力,凸显了其在提供信息丰富且鲁棒的视觉表征方面的重要性。

关键词

引用

@article{arxiv.2401.16459,
  title  = {Bridging Generative and Discriminative Models for Unified Visual Perception with Diffusion Priors},
  author = {Shiyin Dong and Mingrui Zhu and Kun Cheng and Nannan Wang and Xinbo Gao},
  journal= {arXiv preprint arXiv:2401.16459},
  year   = {2024}
}

备注

18 pages,11 figures