用于视觉-语言预训练的全局与局部语义补全学习
计算机视觉与模式识别
2023-12-07 v2
摘要
跨模态对齐在视觉-语言预训练(VLP)模型中起着关键作用,使其能捕捉不同模态间有意义的关联。为此,已有众多掩码建模任务被提出用于VLP以进一步促进跨模态交互。以往掩码建模任务的核心思想是基于可见上下文重建被掩码词元,以学习局部-局部对齐。然而,它们大多忽视为被掩码数据生成的全局语义特征,导致全局表征对另一模态局部特征的跨模态对齐能力受限。因此,本文提出一种新颖的全局与局部语义补全学习(GLSCL)任务,以同时促进全局-局部对齐与局部-局部对齐。具体而言,GLSCL任务通过跨模态交互补全被掩码数据缺失的语义并恢复全局与局部特征。我们的GLSCL由掩码全局语义补全(MGSC)与掩码局部词元补全(MLTC)组成。MGSC促进学习更具代表性的全局特征,其对下游任务性能影响重大;而MLTC重建模态融合局部词元,进一步增强对多模态数据的准确理解。为评估所提方法的跨模态对齐能力,我们构建了名为ALIGN-BENCH的验证基准。此外,我们提出了一种灵活的视觉编码器,使模型能同时执行图像-文本与视频-文本多模态任务。实验结果表明,所提方法在视觉问答、图像-文本检索与视频-文本检索等多种视觉-语言基准上取得了最先进的性能。
引用
@article{arxiv.2306.07096,
title = {Global and Local Semantic Completion Learning for Vision-Language Pre-training},
author = {Rong-Cheng Tu and Yatai Ji and Jie Jiang and Weijie Kong and Chengfei Cai and Wenzhe Zhao and Hongfa Wang and Yujiu Yang and Wei Liu},
journal= {arXiv preprint arXiv:2306.07096},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2211.13437