中文

用于无监督视频目标分割的分层特征对齐网络

计算机视觉与模式识别 2022-07-20 v2

摘要

光流是促进无监督视频目标分割(UVOS)发展的一个易于构想且宝贵的线索。以往大多数方法直接提取并融合运动与表观特征,以在 UVOS 设定下分割目标物体。然而,光流本质上是连续帧间所有像素的瞬时速度,因此使得运动特征在对应帧间与主物体未良好对齐。为解决上述挑战,我们提出一种简洁、实用且高效的表观与运动特征对齐架构,称为分层特征对齐网络(HFAN)。具体而言,HFAN 的关键优势在于顺序的特征对齐(FAM)模块与特征自适应(FAT)模块,它们被用以分层处理表观与运动特征。FAM 能够分别将表观与运动特征与主物体语义表示对齐。此外,FAT 被显式设计用于表观与运动特征的自适应融合,以在跨模态特征间实现理想的权衡。大量实验证明了所提 HFAN 的有效性,其在 DAVIS-16 上达到了新的最先进性能,取得了 88.7 J&F\mathcal{J}\&\mathcal{F} 均值,即相对最佳已发表结果提升了 3.5%。

关键词

引用

@article{arxiv.2207.08485,
  title  = {Hierarchical Feature Alignment Network for Unsupervised Video Object Segmentation},
  author = {Gensheng Pei and Fumin Shen and Yazhou Yao and Guo-Sen Xie and Zhenmin Tang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2207.08485},
  year   = {2022}
}

备注

Accepted by ECCV-2022