中文

MeaCap:记忆增强型零样本图像描述生成

计算机视觉与模式识别 2024-03-07 v1

摘要

在没有良好配对的图像 - 文本数据的情况下,零样本图像描述生成 (IC) 可分为两类:免训练和仅文本训练。通常,这两类方法通过整合预训练的视觉 - 语言模型(如 CLIP)进行图像 - 文本相似度评估,以及预训练的语言模型 (LM) 进行描述生成,来实现零样本 IC。它们之间的主要区别在于是否使用文本语料库来训练 LM。尽管在某些指标上取得了吸引人的性能,但现有方法往往表现出一些共同的缺点。免训练方法倾向于产生幻觉,而仅文本训练往往会丧失泛化能力。为了进一步推进,在本文中,我们提出了一种新颖的记忆增强型零样本图像描述生成框架 (MeaCap)。具体而言,配备文本记忆后,我们引入了一个检索后过滤模块,以获取与图像高度相关的关键概念。通过在关键词到句子 LM 中部署我们提出的记忆增强型视觉相关融合分数,MeaCap 能够生成以概念为中心的描述,这些描述与图像保持高度一致性,同时减少幻觉并增加世界知识。MeaCap 框架在一系列零样本 IC 设置中达到了最先进 (SOTA) 的性能。我们的代码可在 https://github.com/joeyz0z/MeaCap 获取。

关键词

引用

@article{arxiv.2403.03715,
  title  = {MeaCap: Memory-Augmented Zero-shot Image Captioning},
  author = {Zequn Zeng and Yan Xie and Hao Zhang and Chiyu Chen and Zhengjue Wang and Bo Chen},
  journal= {arXiv preprint arXiv:2403.03715},
  year   = {2024}
}

备注

Accepted by CVPR2024