中文

基于多流语料库对齐与双 Softmax 损失的视频文本检索改进

计算机视觉与模式识别 2021-11-23 v3

摘要

采用大规模预训练模型 CLIP 进行视频文本检索任务(VTR)已成为一种新趋势,其性能超越了以往的 VTR 方法。然而,由于视频与文本之间结构和内容的异构性,以往基于 CLIP 的模型在训练阶段容易过拟合,导致检索性能相对较差。在本文中,我们提出了一种带有单门混合专家(CAMoE)的多流语料库对齐网络和一种新颖的双 Softmax 损失(DSL)来解决这两种异构性。CAMoE 采用混合专家提取多视角的视频表示,包括动作、实体、场景等,然后将它们与文本的相应部分进行对齐。在此阶段,我们对特征提取模块和特征对齐模块进行了大量探索。提出 DSL 是为了避免以往对比方法中出现的单向最优匹配。DSL 通过引入一个批次中每对样本的内在先验,作为校正器修正相似度矩阵,从而实现双向最优匹配。DSL 易于实现,仅需一行代码,但效果提升显著。结果表明,所提出的 CAMoE 和 DSL 具有很强的效率,它们各自均能在 MSR-VTT、MSVD 和 LSMDC 等多个基准上达到 SOTA。此外,将两者结合后,性能得到大幅提升,在 MSR-VTT 上的 R@1 超越了以往的 SOTA 方法约 4.6%。

关键词

引用

@article{arxiv.2109.04290,
  title  = {Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss},
  author = {Xing Cheng and Hezheng Lin and Xiangyu Wu and Fan Yang and Dong Shen},
  journal= {arXiv preprint arXiv:2109.04290},
  year   = {2021}
}