中文

面向高效视频-文本检索的掩码对比预训练

计算机视觉与模式识别 2022-12-06 v2 人工智能 计算与语言

摘要

我们提出了一种简洁而有效的端到端视频-语言预训练(VidLP)框架,即掩码对比视频-语言预训练(MAC),用于视频-文本检索任务。我们的 MAC 旨在通过掩码采样机制减少 VidLP 模型中视频表示的空间和时间冗余,以提高预训练效率。与常规的时间稀疏采样相比,我们提出随机掩码高比例的空间区域,并仅将可见区域作为空间稀疏采样输入编码器。类似地,我们对文本输入采用掩码采样技术以保持一致性。我们并未盲目套用 MAE 的先掩码后预测范式,而是提出先掩码后对齐范式以实现高效的视频-文本对齐。其动机在于,视频-文本检索任务依赖于高层对齐而非低层重建,且结合掩码建模的多模态对齐可促使模型从不完整和不稳定的输入中学习鲁棒且通用的多模态表示。这些设计相结合实现了高效的端到端预训练:减少 FLOPs(降低 60%)、加速预训练(3 倍)并提升性能。我们的 MAC 在包括 MSR-VTT、DiDeMo 和 ActivityNet 在内的多个视频-文本检索数据集上取得了最先进(SOTA)结果。我们的方法对输入模态具有通用性。仅需极小修改,我们便在图像-文本检索任务上取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2212.00986,
  title  = {Masked Contrastive Pre-Training for Efficient Video-Text Retrieval},
  author = {Fangxun Shu and Biaolong Chen and Yue Liao and Shuwen Xiao and Wenyu Sun and Xiaobo Li and Yousong Zhu and Jinqiao Wang and Si Liu},
  journal= {arXiv preprint arXiv:2212.00986},
  year   = {2022}
}

备注

Technical Report