利用含噪文本监督扩展视觉与视觉-语言表示学习
计算机视觉与模式识别
2021-06-14 v2 计算与语言
机器学习
摘要
预训练表示正成为许多 NLP 与感知任务的关键。尽管 NLP 中的表示学习已转向在无需人工标注的原始文本上训练,视觉与视觉-语言表示仍严重依赖昂贵的或需要专家知识的精心整理的训练数据集。对于视觉应用,表示大多使用带有显式类标签的数据集(如 ImageNet 或 OpenImages)学习。对于视觉-语言,诸如 Conceptual Captions、MSCOCO 或 CLIP 等流行数据集都涉及非平凡的数据收集(与清洗)过程。这种昂贵的整理过程限制了数据集规模,从而阻碍了训练模型的扩展。本文中,我们利用超过十亿个图像 alt-text 对的含噪数据集,该数据集在 Conceptual Captions 数据集中未经昂贵的过滤或后处理步骤获得。一种简单的双编码器架构使用对比损失学习图像与文本对的图像和语言表示的对齐。我们表明,语料库的规模可弥补其噪声,即便采用如此简单的学习方案也能得到最先进的表示。我们的视觉表示在迁移到 ImageNet 和 VTAB 等分类任务时取得强劲性能。对齐的视觉与语言表示实现了零样本图像分类,并在 Flickr30K 和 MSCOCO 图文检索基准上创下新的最先进结果,即便与更复杂的跨注意力模型相比亦然。这些表示还支持具有复杂文本及文本+图像查询的跨模态搜索。
引用
@article{arxiv.2102.05918,
title = {Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision},
author = {Chao Jia and Yinfei Yang and Ye Xia and Yi-Ting Chen and Zarana Parekh and Hieu Pham and Quoc V. Le and Yunhsuan Sung and Zhen Li and Tom Duerig},
journal= {arXiv preprint arXiv:2102.05918},
year = {2021}
}
备注
ICML 2021