中文

扩展视觉-语言预训练规模以提升图像描述生成

计算机视觉与模式识别 2022-03-29 v2 计算与语言

摘要

近年来,基于视觉-语言预训练(VLP)的图像描述生成任务取得了显著的性能提升。规模被认为是对此进展的重要因素。然而,大多数现有工作仅关注在约400万张图像上对中等规模的transformer(如12层或24层)进行预训练。本文提出LEMON(LargE-scale iMage captiONer,大规模图像描述生成器),并首次对VLP用于图像描述生成的扩展行为进行了实证研究。我们以最先进的VinVL模型作为参考模型,该模型由图像特征提取器和transformer模型组成,并将transformer向上和向下缩放,模型参数量从1300万到6.75亿不等。在数据方面,我们使用多达2亿个图像-文本对进行实验,这些对基于图像的alt属性从网络自动收集(称为ALT200M)。大量分析有助于刻画随着模型规模和预训练数据规模增大时的性能趋势。我们还比较了不同的训练方案,特别是在大规模噪声数据上的训练。结果表明,LEMON在多个主要图像描述生成基准上取得了新的state of the arts(SOTA),包括COCO Caption、nocaps和Conceptual Captions。我们还展示了LEMON在以零样本方式使用时能够生成具有长尾视觉概念的描述。

关键词

引用

@article{arxiv.2111.12233,
  title  = {Scaling Up Vision-Language Pre-training for Image Captioning},
  author = {Xiaowei Hu and Zhe Gan and Jianfeng Wang and Zhengyuan Yang and Zicheng Liu and Yumao Lu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2111.12233},
  year   = {2022}
}