面向零样本视频目标分割的协同注意力传播网络
计算机视觉与模式识别
2023-05-10 v1
摘要
零样本视频目标分割(ZS-VOS)旨在无需先验知识的情况下分割视频序列中的前景目标。然而,现有ZS-VOS方法往往难以区分前景与背景,或在复杂场景中跟踪前景。引入光流等运动信息的常见做法可能导致对光流估计的过度依赖。为应对这些挑战,我们提出了一种基于编码器-解码器的分层协同注意力传播网络(HCPN),能够跟踪并分割目标。具体而言,我们的模型构建于并行协同注意力模块(PCM)与交叉协同注意力模块(CCM)的多次协同演化之上。PCM捕获相邻外观与运动特征间的公共前景区域,而CCM进一步利用并融合PCM返回的交叉模态运动特征。我们的方法经过渐进式训练,以实现整个视频上的分层时空特征传播。实验结果表明,我们的HCPN在公开基准上优于以往所有方法,展现了其在ZS-VOS上的有效性。
引用
@article{arxiv.2304.03910,
title = {Co-attention Propagation Network for Zero-Shot Video Object Segmentation},
author = {Gensheng Pei and Yazhou Yao and Fumin Shen and Dan Huang and Xingguo Huang and Heng-Tao Shen},
journal= {arXiv preprint arXiv:2304.03910},
year = {2023}
}
备注
accepted by IEEE Transactions on Image Processing