中文

F2Net:面向无监督视频目标分割的前景聚焦学习网络

计算机视觉与模式识别 2020-12-07 v1

摘要

尽管基于深度学习的方法在无监督视频目标分割中取得了很大进展,但困难场景(如视觉相似性、遮挡和外观变化)仍未能得到很好处理。为缓解这些问题,我们提出了一种新颖的前景聚焦网络(F2Net),该网络深入挖掘前景目标在帧内与帧间的细节信息,从而有效提升分割性能。具体而言,我们提出的网络由三个主要部分组成:孪生编码器模块、中心引导外观扩散模块和动态信息融合模块。首先,我们采用孪生编码器提取配对帧(参考帧与当前帧)的特征表示。然后,设计中心引导外观扩散模块来捕获帧间特征(参考帧与当前帧之间的密集对应关系)、帧内特征(当前帧内的密集对应关系)以及当前帧的原始语义特征。具体地,我们建立中心预测分支来预测当前帧中前景目标的中心位置,并利用中心点信息作为空间引导先验以增强帧间与帧内特征提取,从而使特征表示显著聚焦于前景目标。最后,我们提出动态信息融合模块,通过前述三种不同层级的特征自动选择相对重要的特征。在 DAVIS2016、Youtube-object 和 FBMS 数据集上的大量实验表明,我们提出的 F2Net 取得了最先进的性能并实现显著提升。

关键词

引用

@article{arxiv.2012.02534,
  title  = {F2Net: Learning to Focus on the Foreground for Unsupervised Video Object Segmentation},
  author = {Daizong Liu and Dongdong Yu and Changhu Wang and Pan Zhou},
  journal= {arXiv preprint arXiv:2012.02534},
  year   = {2020}
}

备注

Accepted by AAAI2021