MoMo:一种用于文本、图像与多模态表示的共享编码器模型
计算机视觉与模式识别
2023-04-13 v1 人工智能
计算与语言
摘要
我们提出了一种自监督共享编码器模型,该模型在多个视觉、语言和多模态基准上取得了强劲结果,同时在数据、内存和运行时间上高效。我们做出了三项关键贡献。首先,与多数现有工作不同,我们使用单一 transformer,其所有编码器层同时处理文本与图像两种模态。其次,我们提出了一种分阶段训练策略:模型先基于图像训练,继而与单模态文本和图像数据集联合训练,最后与文本及文本-图像数据集联合训练。第三,为跨两种模态保留信息,我们提出了一种训练流程,在每一训练更新步中同时从各模态的梯度更新中学习。在下游纯文本、纯图像及多模态任务上的结果表明,我们的模型在使用更少参数与更少预训练数据的情况下可与若干强模型竞争。例如,尽管参数数量仅为 2/5、使用的图文训练对仅为 1/3,MoMo 在多模态(+3.1)、纯图像(+1.1)和纯文本(-0.1)任务上与 FLAVA 表现相当。最后,我们对各种设计选择进行了消融实验,并进一步表明增大模型规模可带来显著性能提升,表明采用我们的方法在更大模型上具备可观改进潜力。
引用
@article{arxiv.2304.05523,
title = {MoMo: A shared encoder Model for text, image and multi-Modal representations},
author = {Rakesh Chada and Zhaoheng Zheng and Pradeep Natarajan},
journal= {arXiv preprint arXiv:2304.05523},
year = {2023}
}