中文

CoCa:作为图文基础模型的对比描述生成器

计算机视觉与模式识别 2022-06-15 v2 机器学习 多媒体

摘要

探索大规模预训练基础模型在计算机视觉中具有重要意义,因为这些模型可快速迁移至许多下游任务。本文提出对比描述生成器(CoCa),一种极简设计,通过对比损失与描述生成损失联合预训练图文编码器-解码器基础模型,从而囊括了如 CLIP 等对比方法与如 SimVLM 等生成方法的能力。与标准编码器-解码器 transformer 中所有解码器层都关注编码器输出不同,CoCa 在前半部分解码器层中省略交叉注意力以编码单模态文本表示,并级联其余交叉关注图像编码器以得到多模态图文表示的解码器层。我们在单模态图像与文本嵌入间施加对比损失,并对多模态解码器输出施加描述生成损失以自回归预测文本词元。通过共享同一计算图,两个训练目标以极小开销高效计算。CoCa 从头开始在网页级 alt-text 数据与标注图像上端到端预训练,将所有标签简单视为文本,无缝统一了用于表示学习的自然语言监督。实证上,CoCa 在广泛下游任务上以零样本迁移或最小任务特定适配取得了最先进性能,涵盖视觉识别(ImageNet、Kinetics-400/600/700、Moments-in-Time)、跨模态检索(MSCOCO、Flickr30K、MSR-VTT)、多模态理解(VQA、SNLI-VE、NLVR2)和图像描述生成(MSCOCO、NoCaps)。尤其在 ImageNet 分类上,CoCa 取得 86.3% 零样本 top-1 准确率,使用冻结编码器与可学习分类头达 90.6%,并以微调编码器在 ImageNet 上创下 91.0% top-1 准确率的新最先进水平。

关键词

引用

@article{arxiv.2205.01917,
  title  = {CoCa: Contrastive Captioners are Image-Text Foundation Models},
  author = {Jiahui Yu and Zirui Wang and Vijay Vasudevan and Legg Yeung and Mojtaba Seyedhosseini and Yonghui Wu},
  journal= {arXiv preprint arXiv:2205.01917},
  year   = {2022}
}

备注

Preprint