中文

面向语言查询视频演员分割的协同时空建模

计算机视觉与模式识别 2021-05-17 v1 多媒体

摘要

语言查询视频演员分割旨在预测目标帧中执行自然语言查询所描述动作的演员的像素级掩码。现有方法在视频片段上采用 3D CNN 作为通用编码器,为目标帧提取混合的时空特征。尽管 3D 卷积有助于识别哪个演员在执行查询动作,它也不可避免地引入了来自相邻帧的未对齐空间信息,从而混淆目标帧的特征并导致不准确的分割。因此,我们提出一种协同时空编码器-解码器框架,包含视频片段上的 3D 时间编码器以识别查询动作,以及目标帧上的 2D 空间编码器以准确分割查询演员。在解码器中,提出语言引导特征选择(LGFS)模块以灵活整合来自两个编码器的空间与时间特征。我们还提出跨模态自适应调制(CMAM)模块,以动态重组空间与时间相关的语言特征,用于两个编码器各阶段中的多模态特征交互。我们的方法在两个流行基准上以比先前方法更少的计算开销取得了新的最先进性能。

关键词

引用

@article{arxiv.2105.06818,
  title  = {Collaborative Spatial-Temporal Modeling for Language-Queried Video Actor Segmentation},
  author = {Tianrui Hui and Shaofei Huang and Si Liu and Zihan Ding and Guanbin Li and Wenguan Wang and Jizhong Han and Fei Wang},
  journal= {arXiv preprint arXiv:2105.06818},
  year   = {2021}
}

备注

Accepted by CVPR 2021