SOHO:端到端视觉语言表征学习预训练
计算机视觉与模式识别
2021-04-09 v2
摘要
我们研究卷积神经网络(CNN)与Transformer的联合学习用于视觉语言预训练(VLPT),旨在从数百万图像-文本对中学习跨模态对齐。最先进的方法提取显著图像区域并逐步将区域与词对齐。由于基于区域的视觉特征通常代表图像的部分,现有视觉语言模型难以充分理解来自配对自然语言的语义。本文提出SOHO以“See Out of tHe bOx”,将整幅图像作为输入,并以端到端方式学习视觉语言表征。SOHO不需要边界框标注,推理速度比基于区域的方法快10倍。特别地,SOHO通过视觉词典(VD)学习提取全面而紧凑的图像特征,以促进跨模态理解。VD设计为表示相似语义的一致视觉抽象,其在线更新并用于我们提出的预训练任务掩码视觉建模(MVM)。我们遵循标准VLPT设置,在四个成熟的视觉语言任务上开展实验。具体地,SOHO在MSCOCO文本检索5k测试集上R@1分数绝对提升2.0%,在NLVR test-P分割上准确率提升1.5%,在SNLI-VE测试集上准确率提升6.7%。
引用
@article{arxiv.2104.03135,
title = {Seeing Out of tHe bOx: End-to-End Pre-training for Vision-Language Representation Learning},
author = {Zhicheng Huang and Zhaoyang Zeng and Yupan Huang and Bei Liu and Dongmei Fu and Jianlong Fu},
journal= {arXiv preprint arXiv:2104.03135},
year = {2021}
}
备注
Accepted by CVPR2021 oral