通过纯文本训练挖掘细粒度图像-文本对齐用于零样本描述生成
计算机视觉与模式识别
2024-01-05 v1 人工智能
摘要
图像描述生成旨在生成图像的描述性和有意义的文本描述,从而实现广泛的视觉-语言应用。先前的工作已经证明,利用对比图像语言预训练(CLIP)的力量为实现零样本描述生成提供了一种有前景的方法,消除了对昂贵描述标注的需求。然而,CLIP潜在空间中广泛观察到的模态差距通过破坏配对图像-文本特征之间的对齐而损害了零样本描述生成的性能。为了解决这个问题,我们对CLIP潜在空间进行了分析,得出了两个发现。首先,我们观察到,由于文本描述中固有的信息损失,图像子区域的CLIP视觉特征可以更接近配对的描述。此外,我们表明,配对图像-文本之间的模态差距可以经验地建模为零均值高斯分布。受这些发现的启发,我们提出了一种新颖的零样本图像描述生成框架,通过纯文本训练来减少模态差距。具体来说,我们引入了子区域特征聚合以利用局部区域信息,从而产生用于匹配文本表示的紧凑视觉表示。此外,我们结合了噪声注入和CLIP重排序策略来提升描述生成性能。我们还将我们的框架扩展到构建零样本VQA流水线,展示了其通用性。通过在常见描述生成和VQA数据集(如MSCOCO、Flickr30k和VQAV2)上的大量实验,我们表明我们的方法实现了显著的性能提升。代码可在https://github.com/Artanic30/MacCap获取。
引用
@article{arxiv.2401.02347,
title = {Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training},
author = {Longtian Qiu and Shan Ning and Xuming He},
journal= {arXiv preprint arXiv:2401.02347},
year = {2024}
}
备注
AAAI 2024.Open sourced, Code and Model Available