Uni-EDEN:基于多粒度视觉-语言预训练的通用编码器-解码器网络
计算机视觉与模式识别
2022-01-12 v1 计算与语言
多媒体
摘要
视觉-语言预训练已成为一个新兴且快速发展的研究课题,其将多模态知识从富资源预训练任务迁移至贫资源下游任务。不同于现有工作主要学习单一通用编码器,我们提出一种可预训练的通用编码器-解码器网络(Uni-EDEN)以同时促进视觉-语言感知(如视觉问答)与生成(如图像字幕)。Uni-EDEN 是基于双流 Transformer 的结构,由三个模块组成:分别学习各模态表征的物体与句子编码器,以及通过模态间交互实现多模态推理与句子生成的句子解码器。考虑到每幅图像的语言表征在该层次中可跨越不同粒度,包括从简单到完整的个体标签、短语和自然句子,我们通过多粒度视觉-语言代理任务预训练 Uni-EDEN:掩码物体分类(MOC)、掩码区域短语生成(MRPG)、图像-句子匹配(ISM)和掩码句子生成(MSG)。由此,Uni-EDEN 被赋予多模态表征提取与语言建模的双重能力。大量实验通过将 Uni-EDEN 微调至四个视觉-语言感知与生成下游任务,证明了其引人注目的泛化性。
引用
@article{arxiv.2201.04026,
title = {Uni-EDEN: Universal Encoder-Decoder Network by Multi-Granular Vision-Language Pre-training},
author = {Yehao Li and Jiahao Fan and Yingwei Pan and Ting Yao and Weiyao Lin and Tao Mei},
journal= {arXiv preprint arXiv:2201.04026},
year = {2022}
}
备注
ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)