中文

面向压缩视频指代物体分割的多注意力网络

计算机视觉与模式识别 2022-07-27 v1

摘要

指代视频物体分割旨在分割由给定语言表达式所指代的物体。现有工作通常要求将压缩视频码流解码为 RGB 帧后再进行分割,这增加了计算与存储需求并最终拖慢推理速度。这可能阻碍其在自动驾驶汽车与无人机等现实世界计算资源受限场景中的应用。为缓解该问题,本文探索压缩视频(即原始视频数据流)上的指代物体分割任务。除视频指代物体分割任务本身的固有难度外,从压缩视频中获取判别性表示也颇具挑战。为此,我们提出一个由双路双注意力模块与基于查询的跨模态 Transformer 模块组成的多注意力网络。具体而言,双路双注意力模块旨在从 I 帧、运动向量与残差三种模态的压缩数据中提取有效表示。基于查询的跨模态 Transformer 首先建模语言与视觉模态间的关联,随后融合的多模态特征被用于引导物体查询生成内容感知的动态核并预测最终分割掩码。与以往工作不同,我们提出仅学习一个核,从而去除了现有方法复杂的掩码后匹配过程。在三个具挑战性数据集上的大量 promising 实验结果表明,相较于若干为处理 RGB 数据而提出的 SOTA 方法,本方法有效。源代码见:https://github.com/DexiangHong/MANet。

关键词

引用

@article{arxiv.2207.12622,
  title  = {Multi-Attention Network for Compressed Video Referring Object Segmentation},
  author = {Weidong Chen and Dexiang Hong and Yuankai Qi and Zhenjun Han and Shuhui Wang and Laiyun Qing and Qingming Huang and Guorong Li},
  journal= {arXiv preprint arXiv:2207.12622},
  year   = {2022}
}

备注

Accepted by ACM MM 2022