中文

LaT:用于视频文本检索的具有循环一致性的隐空间翻译

计算机视觉与模式识别 2023-02-14 v2 多媒体

摘要

视频文本检索是一类跨模态表示学习问题,其目标是在给定文本查询与候选视频池中筛选出与该文本查询对应的视频。视觉语言预训练的对比范式已在大规模数据集与统一 transformer 架构下展现出可喜的成功,并证明了联合隐空间的能力。尽管如此,视觉域与文本域之间的内在差异仍远未消除,且将不同模态投影至联合隐空间可能导致单模态内部信息的扭曲。为克服上述问题,我们提出了一种无需联合隐空间即可学习从源模态空间S\mathcal{S}到目标模态空间T\mathcal{T}翻译关系的新机制,从而弥合视觉与文本域之间的鸿沟。此外,为保持翻译间的循环一致性,我们采用了一个包含从S\mathcal{S}到预测目标空间T\mathcal{T'}的前向翻译以及从T\mathcal{T'}回至S\mathcal{S}的后向翻译的循环损失。在 MSR-VTT、MSVD 与 DiDeMo 数据集上进行的广泛实验证明了我们的 LaT 方法相较于普通 SOTA 方法的优越性与有效性。

关键词

引用

@article{arxiv.2207.04858,
  title  = {LaT: Latent Translation with Cycle-Consistency for Video-Text Retrieval},
  author = {Jinbin Bai and Chunhui Liu and Feiyue Ni and Haofan Wang and Mengying Hu and Xiaofeng Guo and Lele Cheng},
  journal= {arXiv preprint arXiv:2207.04858},
  year   = {2023}
}