ROSITA:通过跨模态与模态内知识整合增强视觉-语言语义对齐
计算机视觉与模式识别
2021-08-17 v1 计算与语言
摘要
视觉-语言预训练(VLP)旨在从海量图像-文本对中学习通用多模态表示。尽管已有多种成功尝试,学习图像-文本对之间的细粒度语义对齐在其方法中起着关键作用。然而,多数现有 VLP 方法未充分利用图像-文本对内部的内在知识,这限制了所学对齐的有效性并进一步制约了模型性能。为此,我们提出一种称为 ROSITA 的新 VLP 方法,其将跨模态与模态内知识整合于统一场景图中以增强语义对齐。具体而言,我们引入一种新颖的结构化知识掩码(SKM)策略,利用场景图结构作为先验执行掩码语言(区域)建模,通过消除模态内与跨模态的干扰信息来增强语义对齐。大量消融研究与综合分析验证了 ROSITA 在语义对齐上的有效性。ROSITA 在域内与域外数据集上预训练后,在六个基准数据集上的三个典型视觉-语言任务中显著优于现有最优 VLP 方法。
引用
@article{arxiv.2108.07073,
title = {ROSITA: Enhancing Vision-and-Language Semantic Alignments via Cross- and Intra-modal Knowledge Integration},
author = {Yuhao Cui and Zhou Yu and Chunqi Wang and Zhongzhou Zhao and Ji Zhang and Meng Wang and Jun Yu},
journal= {arXiv preprint arXiv:2108.07073},
year = {2021}
}
备注
Accepted at ACM Multimedia 2021. Code available at https://github.com/MILVLG/rosita