中文

HiT:基于动量对比的分层Transformer用于视频-文本检索

计算机视觉与模式识别 2021-08-19 v2 人工智能

摘要

随着互联网上多媒体数据的增长,视频-文本检索已成为一个热门研究课题。用于视频-文本学习的Transformer因其良好的性能而受到越来越多的关注。然而,现有的跨模态Transformer方法通常存在两个主要局限:1)对Transformer架构中不同层具有不同特征特性的利用有限;2)端到端训练机制限制了小批量内的负样本交互。本文提出一种名为分层Transformer(HiT)的视频-文本检索新方法。HiT在特征层和语义层执行分层跨模态对比匹配,实现多视角且全面的检索结果。此外,受MoCo启发,我们提出动量跨模态对比用于跨模态学习,以即时实现大规模负样本交互,这有助于生成更精确且具有判别性的表示。在三个主要视频-文本检索基准数据集上的实验结果证明了我们方法的优势。

关键词

引用

@article{arxiv.2103.15049,
  title  = {HiT: Hierarchical Transformer with Momentum Contrast for Video-Text Retrieval},
  author = {Song Liu and Haoqi Fan and Shengsheng Qian and Yiru Chen and Wenkui Ding and Zhongyuan Wang},
  journal= {arXiv preprint arXiv:2103.15049},
  year   = {2021}
}