用于图像描述的视觉-语言模型线性对齐
计算机视觉与模式识别
2025-02-11 v4 计算与语言
机器学习
摘要
近来,诸如CLIP之类的视觉-语言模型在包括图像描述和描述评估在内的多种多模态任务中推进了最先进水平。许多方法利用CLIP进行跨模态检索,以将预训练语言模型条件化于视觉输入。然而,CLIP在联合嵌入空间中通常存在图像与文本模态未对齐的问题。我们研究了用于图像描述下游任务、对联合嵌入空间进行线性重新对齐的高效方法。这带来了一种高效的训练协议,仅需在联合CLIP空间中计算线性映射的闭式解。因此,我们提出了一种称为ReCap的轻量描述方法,其训练速度可达现有轻量方法的1000倍。此外,我们基于CLIP分数及所提对齐提出了两种新的基于学习的图像描述指标。我们在MS-COCO、Flickr30k、VizWiz和MSRVTT上评估了ReCap。在前两个数据集上,ReCap在使用基于规则指标时性能与最先进轻量方法相当,而在大多数基于CLIP的指标上优于它们。在后两个基准上,ReCap在所有指标上持续优于竞争对手,并展现出强大的迁移能力和抗噪性。最后,我们证明所提指标在Flickr8k-Expert、Flickr8k-Crowdflower和THumB数据集上与人类判断的相关性优于现有指标。
引用
@article{arxiv.2307.05591,
title = {Linear Alignment of Vision-language Models for Image Captioning},
author = {Fabian Paischer and Markus Hofmarcher and Sepp Hochreiter and Thomas Adler},
journal= {arXiv preprint arXiv:2307.05591},
year = {2025}
}
备注
9 pages (+ references and appendix)