中文

BiC-Net: 学习高效的时空关系用于文本-视频检索

计算机视觉与模式识别 2022-06-02 v3 信息检索

摘要

文本-视频检索任务旨在理解语言与视觉之间的对应关系,近年来受到越来越多的关注。以往研究要么采用现成的 2D/3D-CNN 然后利用平均/最大池化直接以聚合的时间信息捕获空间特征作为全局视频嵌入,要么引入基于图的模型和专家知识来学习局部时空关系。然而,现有方法有两个局限:1) 全局视频表示以简单的平均/最大池化方式学习视频时间信息,未能充分探索每两帧之间的时间信息。2) 基于图的局部视频表示是手工设计的,严重依赖专家知识和经验反馈,可能无法有效挖掘更高层次的细粒度视觉关系。这些局限导致它们无法区分具有相同的视觉成分但关系不同的视频。为解决此问题,我们提出一种新颖的跨模态检索框架,双分支互补网络(BiC-Net),其改进 transformer 架构,通过结合局部时空关系和全局时间信息以互补方式有效桥接文本-视频模态。具体而言,局部视频表示使用多个 transformer 块和额外的残差块编码以学习时空关系特征,称该模块为时空残差 transformer (SRT)。同时,全局视频表示使用多层 transformer 块编码以学习全局时间特征。最后,我们在两个嵌入空间上将时空关系和全局时间特征与文本特征对齐,用于跨模态文本-视频检索。

关键词

引用

@article{arxiv.2110.15609,
  title  = {BiC-Net: Learning Efficient Spatio-Temporal Relation for Text-Video Retrieval},
  author = {Ning Han and Jingjing Chen and Chuhao Shi and Yawen Zeng and Guangyi Xiao and Hao Chen},
  journal= {arXiv preprint arXiv:2110.15609},
  year   = {2022}
}

备注

12 pages