mPLUG-2:一种跨文本、图像与视频的模块化多模态基础模型
计算机视觉与模式识别
2023-05-12 v1 计算与语言
多媒体
摘要
近年来,语言、视觉与多模态预训练呈现出大融合。本工作中,我们提出mPLUG-2,一种用于多模态预训练的模块化设计统一范式,其可受益于模态协作,同时解决模态纠缠问题。不同于仅依赖序列到序列生成或基于编码器的实例判别的主流范式,mPLUG-2引入多模块组合网络,通过共享通用公共模块实现模态协作,并解耦不同模态模块以应对模态纠缠。它可灵活地为跨所有模态(包括文本、图像和视频)的不同理解与生成任务选择不同模块。实证研究表明,mPLUG-2在涵盖图像-文本与视频-文本理解和生成的多模态任务,以及纯文本、纯图像和纯视频理解的单模态任务等广泛30余项下游任务上取得了最先进或具竞争力的结果。值得注意的是,mPLUG-2在具挑战性的MSRVTT视频问答和视频描述任务上以远小的模型规模和数据规模取得了48.0 top-1准确率和80.3 CIDEr的新最先进结果。它还展现出在视觉-语言与视频-语言任务上的强零样本迁移能力。代码与模型将于 https://github.com/alibaba/AliceMind 发布。
引用
@article{arxiv.2302.00402,
title = {mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video},
author = {Haiyang Xu and Qinghao Ye and Ming Yan and Yaya Shi and Jiabo Ye and Yuanhong Xu and Chenliang Li and Bin Bi and Qi Qian and Wei Wang and Guohai Xu and Ji Zhang and Songfang Huang and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2302.00402},
year = {2023}
}