中文

DeCap:通过纯文本训练解码 CLIP 隐变量实现零样本图像描述

计算机视觉与模式识别 2023-03-07 v1 人工智能 计算与语言

摘要

大规模预训练多模态模型(如 CLIP)在许多判别任务中展现出强大的零样本迁移能力。它们对零样本图像条件文本生成任务的适配已引起越来越多的兴趣。先前方法或通过利用现有大语言模型(如 GPT-2),或以端到端方式预训练编码器-解码器网络来实现零样本描述。本工作中,我们提出一个名为 DeCap 的简洁框架用于零样本描述。我们引入一个轻量的视觉感知语言解码器。该解码器兼具数据高效与计算高效:1)它仅需文本数据训练,减轻了配对数据收集的负担。2)它不需要端到端训练。当使用纯文本数据训练时,解码器将现成 CLIP 编码器提取的文本嵌入作为前缀嵌入。挑战在于解码器在文本语料上训练,但在推理阶段需基于视觉输入生成描述。多模态对比模型中广泛存在的模态鸿沟问题阻碍了我们直接将视觉嵌入作为前缀嵌入。我们提出一种无训练机制来缩小模态鸿沟。我们将视觉嵌入投影到 CLIP 文本嵌入空间中,同时投影后的嵌入保留视觉输入的信息。以投影嵌入作为前缀嵌入,解码器生成与视觉输入匹配的高质量描述。实验表明,DeCap 在典型图像描述基准 MSCOCO 和 NoCaps 上优于其他零样本描述方法与无配对描述方法。

关键词

引用

@article{arxiv.2303.03032,
  title  = {DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training},
  author = {Wei Li and Linchao Zhu and Longyin Wen and Yi Yang},
  journal= {arXiv preprint arXiv:2303.03032},
  year   = {2023}
}

备注

Accepted by ICLR 2023. Code is available at https://github.com/dhg-wei/DeCap