UNIMO-3:用于视觉-语言表征学习的多粒度交互
计算与语言
2023-05-24 v1
摘要
视觉-语言(VL)预训练旨在学习图像-文本对的通用表征,可迁移至各类视觉-语言任务。与单模态数据建模相比,VL模型的主要挑战在于:如何从多模态数据中学习跨模态交互,尤其是细粒度交互。已有工作表明,采用注意力机制学习层内跨模态交互的完全基于transformer的模型,在各种跨模态下游任务上展现出令人印象深刻的性能。然而,它们忽略了同一层中不同模态的语义信息并不均匀,导致跨模态交互退化为有限的多模态语义信息交互。在本工作中,我们提出UNIMO-3模型,其能够同时学习多模态层内交互与跨层交互。UNIMO-3模型可在跨模态编码器中建立不同层之间的有效连接,并自适应地捕捉两个模态在不同层次上的交互。实验结果表明,我们的模型在各种下游任务上取得了最先进的性能,且通过消融研究可证明有效的跨层学习提升了模型的多模态表征能力。
引用
@article{arxiv.2305.13697,
title = {UNIMO-3: Multi-granularity Interaction for Vision-Language Representation Learning},
author = {Hao Yang and Can Gao and Hao Líu and Xinyan Xiao and Yanyan Zhao and Bing Qin},
journal= {arXiv preprint arXiv:2305.13697},
year = {2023}
}