图像描述器亦是可扩展的视觉学习器
计算机视觉与模式识别
2023-12-22 v5
摘要
基于网络图像-文本对的对比预训练是视觉骨干网络(尤其在大规模多模态模型背景下)最流行的规模化预训练策略之一。与此同时,在此类数据上的图像描述常被认为是一种较差的预训练策略。本文中,我们对这两种预训练策略进行了公平比较,仔细匹配训练数据、计算量和模型容量。使用标准编码器-解码器 Transformer,我们发现仅用描述任务出奇地有效:在分类任务上,描述训练出的视觉编码器可与对比预训练编码器媲美,而在视觉与语言任务上超越它们。我们进一步分析了模型架构与规模以及预训练数据对表征质量的影响,发现描述在这些维度上展现出同等或更优的扩展行为。总体而言,我们的结果表明普通图像描述是一种比此前所认为更强大的预训练策略。
引用
@article{arxiv.2306.07915,
title = {Image Captioners Are Scalable Vision Learners Too},
author = {Michael Tschannen and Manoj Kumar and Andreas Steiner and Xiaohua Zhai and Neil Houlsby and Lucas Beyer},
journal= {arXiv preprint arXiv:2306.07915},
year = {2023}
}
备注
Accepted at NeurIPS 2023. v2 adds SugarCrepe results and more ablations, v3 has minor fixes. v4 adds a code link ( https://github.com/google-research/big_vision ). v5 has minor fixes