OPT:面向跨模态理解与生成的全感知预训练器
计算机视觉与模式识别
2021-07-07 v2
摘要
本文中,我们提出一种用于跨模态理解与生成的全感知预训练器(OPT),通过联合建模视觉、文本与音频资源。OPT 构建于编码器-解码器框架中,包括三个单模态编码器以为每种模态生成基于 token 的嵌入、一个跨模态编码器以编码三种模态间的相关性,以及两个跨模态解码器分别生成文本与图像。针对 OPT 的预训练,我们设计了一种多任务 pretext 学习方案,从三种不同数据粒度(即 token 级、模态级与样本级建模)对多模态资源建模,OPT 借此学习不同模态间的对齐与转换。预训练任务在来自 Open Images 的大量图像-文本-音频三元组上执行。实验结果表明,OPT 能学习强大的图像-文本-音频多模态表示,并在多种跨模态理解与生成任务上取得有前景的结果。
引用
@article{arxiv.2107.00249,
title = {OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation},
author = {Jing Liu and Xinxin Zhu and Fei Liu and Longteng Guo and Zijia Zhao and Mingzhen Sun and Weining Wang and Hanqing Lu and Shiyu Zhou and Jiajun Zhang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2107.00249},
year = {2021}
}