中文

掩码重构:面向视频文本检索的协同语义补全

计算机视觉与模式识别 2023-05-16 v1

摘要

近来,掩码视频建模被广泛探索,并显著提升了模型在局部层面对视觉区域的理解能力。然而,现有方法通常采用随机掩码并沿用相同重构范式补全掩码区域,未能利用跨模态内容间的相关性。本文提出基于语义掩码建模的语义补全掩码方法(MASCOT)。具体而言,在应用基于注意力的视频掩码生成高信息量与低信息量掩码后,我们提出信息语义补全以恢复被掩码的语义信息。该恢复机制通过将掩码内容与未掩码视觉区域及对应文本上下文对齐实现,使模型在块级别捕获更多文本相关细节。此外,我们将重构重点从无关背景转移至判别性区域,以忽略低信息量掩码区域。进一步,我们设计双掩码协同学习,以融合不同掩码下的视频线索并学习更对齐的视频表征。我们的 MASCOT 在 MSR-VTT、LSMDC、ActivityNet 和 DiDeMo 四个主要文本-视频检索基准上取得 SOTA 性能。大量消融实验证明了所提方案的有效性。

关键词

引用

@article{arxiv.2305.07910,
  title  = {Mask to reconstruct: Cooperative Semantics Completion for Video-text Retrieval},
  author = {Han Fang and Zhifei Yang and Xianghao Zang and Chao Ban and Hao Sun},
  journal= {arXiv preprint arXiv:2305.07910},
  year   = {2023}
}