看见你所遗漏的:基于语义补全学习的视觉-语言预训练
计算机视觉与模式识别
2023-03-28 v2 计算与语言
多媒体
摘要
跨模态对齐对于视觉-语言预训练(VLP)模型学习不同模态间正确对应信息至关重要。为此,受自然语言处理预训练领域掩码语言建模(MLM)任务成功的启发,众多掩码建模任务被提出用于 VLP 以进一步促进跨模态交互。以往掩码建模任务的核心思想是基于可见上下文重建被掩码词元以学习局部到局部的对齐。然而,它们大多很少关注为被掩码数据生成的全局语义特征,导致全局表示的跨模态对齐能力有限。因此,本文提出一种新颖的语义补全学习(SCL)任务,作为现有掩码建模任务的补充,以促进全局到局部的对齐。具体而言,SCL 任务通过从另一模态捕获对应信息来补全被掩码数据缺失的语义,促进学习更具代表性的全局特征,这对下游任务性能有重大影响。此外,我们提出了一种灵活的视觉编码器,使我们的模型能同时执行图像-文本与视频-文本多模态任务。实验结果表明,我们提出的方法在各种视觉-语言基准上取得了最先进的性能,如视觉问答、图像-文本检索和视频-文本检索。
引用
@article{arxiv.2211.13437,
title = {Seeing What You Miss: Vision-Language Pre-training with Semantic Completion Learning},
author = {Yatai Ji and Rongcheng Tu and Jie Jiang and Weijie Kong and Chengfei Cai and Wenzhe Zhao and Hongfa Wang and Yujiu Yang and Wei Liu},
journal= {arXiv preprint arXiv:2211.13437},
year = {2023}
}
备注
CVPR 2023 accept