用于基于扩散的视觉感知的隐式和显式语言引导
计算机视觉与模式识别
2024-08-16 v3
摘要
文本到图像扩散模型在条件图像合成方面展现出强大的能力。通过大规模视觉语言预训练,扩散模型能够在不同文本提示下生成具有丰富纹理和合理结构的高质量图像。然而,如何将预训练的扩散模型应用于视觉感知仍是一个开放性问题。在本文中,我们提出了一种用于基于扩散的感知的隐式和显式语言引导框架,命名为IEDP。我们的IEDP包含一个隐式语言引导分支和一个显式语言引导分支。隐式分支使用冻结的CLIP图像编码器直接生成隐式文本嵌入,并将其馈送到扩散模型,无需使用显式文本提示。显式分支利用对应图像的真实标签作为文本提示,以调节扩散模型的特征提取。在训练期间,我们通过共享这两个分支的模型权重来联合训练扩散模型。因此,隐式和显式分支可以共同引导特征学习。在推理期间,我们仅使用隐式分支进行最终预测,这不需要任何真实标签。实验在两个典型的感知任务上进行,包括语义分割和深度估计。我们的IEDP在这两个任务上都取得了有前景的性能。对于语义分割,我们的IEDP在AD20K验证集上的mIoU得分为55.9%,比基线方法VPD高出2.2%。对于深度估计,我们的IEDP以11.0%的相对增益优于基线方法VPD。
引用
@article{arxiv.2404.07600,
title = {Implicit and Explicit Language Guidance for Diffusion-based Visual Perception},
author = {Hefeng Wang and Jiale Cao and Jin Xie and Aiping Yang and Yanwei Pang},
journal= {arXiv preprint arXiv:2404.07600},
year = {2024}
}
备注
Accepted by IEEE TMM