释放文本到图像扩散先验用于零样本图像描述
计算机视觉与模式识别
2025-01-03 v1 计算与语言
机器学习
多媒体
摘要
最近,零样本图像描述获得了越来越多的关注,其中仅使用文本数据进行训练。文本到图像扩散模型的显著进展为解决这一任务提供了潜在解决方案,方法是利用预训练的先验生成合成图像-文本对。然而,合成图像中显著区域细节的缺失会导致合成图像与文本之间的语义错位,从而导致结果受损。为解决这一挑战,我们提出了一种新的 Patch-wise Cross-modal feature Mix-up (PCM) 机制,用于在训练时以细粒度方式自适应地缓解合成内容的不忠实问题,可以集成到大多数编码器-解码器框架中,形成我们的 PCM-Net。具体而言,对于每个输入图像,首先考虑图像-文本在 CLIP 空间中的相似性检测图像中的显著视觉概念。接下来,选择性地将输入图像的 patch-wise 视觉特征与显著视觉概念的文本特征融合,从而产生较少缺陷内容的混合图。最后,利用视觉-语义编码器对派生的特征图进行精炼,然后纳入句子解码器用于描述生成。此外,为了便于使用合成数据训练模型,设计了一个新的 CLIP 加权交叉熵损失,以优先处理高质量的图像-文本对而非低质量的图像-文本对。在 MSCOCO 和 Flickr30k 数据集上的大量实验表明,我们的 PCM-Net 在与最先进的视觉-语言模型方法相比具有优势。值得一提的是,我们的 PCM-Net 在域内和跨域零样本图像描述中均名列第一。合成数据集 SynthImgCap 和代码已提供。
引用
@article{arxiv.2501.00437,
title = {Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning},
author = {Jianjie Luo and Jingwen Chen and Yehao Li and Yingwei Pan and Jianlin Feng and Hongyang Chao and Ting Yao},
journal= {arXiv preprint arXiv:2501.00437},
year = {2025}
}
备注
ECCV 2024