CoBIT:一种对比式双向图像-文本生成模型
计算机视觉与模式识别
2023-03-24 v1 计算与语言
摘要
视觉与语言领域见证了预训练基础模型的激增。大多数现有方法采用独立的预训练目标,如类 CLIP 的对比目标、类 PaLI 的图像到文本生成目标,或类 Parti 的文本到图像生成目标。然而,这三种目标可在同一数据(图像-文本对)上预训练,且直观上它们互为补充:对比提供全局对齐能力,而生成赋予细粒度理解。本工作中,我们提出一种对比式双向图像-文本生成模型(CoBIT),尝试将三种预训练目标统一于一个框架中。具体而言,CoBIT 采用一种新颖的单编码器-解码器结构,由图像单编码器、文本单编码器和跨模态解码器组成。图像/文本单编码器可在不同任务中在编码与解码间切换,带来灵活性及有益于图像到文本与文本到图像生成的知识共享。CoBIT 在图像理解、图像-文本理解(检索、描述生成、VQA、SNLI-VE)以及基于文本的内容生成中取得优越性能,尤其在零样本场景下。例如,零样本 ImageNet 分类达 82.7%,零样本文本到图像生成 FID 分数为 9.37,零样本描述生成 CIDEr 为 44.8。
引用
@article{arxiv.2303.13455,
title = {CoBIT: A Contrastive Bi-directional Image-Text Generation Model},
author = {Haoxuan You and Mandy Guo and Zhecan Wang and Kai-Wei Chang and Jason Baldridge and Jiahui Yu},
journal= {arXiv preprint arXiv:2303.13455},
year = {2023}
}
备注
14 pages, 5 figures