中文

用于视频目标分割的全局频谱滤波记忆网络

计算机视觉与模式识别 2022-10-13 v2

摘要

本文通过增强帧内交互来研究半监督视频目标分割。最近基于记忆网络的方法侧重于利用帧间时间参考,而很少关注帧内空间依赖性。具体而言,这些分割模型容易受到某一帧中不相关的非目标物体的干扰。为此,我们提出了全局频谱滤波记忆网络(GSFM),它通过在频谱域中学习长期空间依赖性来改善帧内交互。GSFM 的关键组件是用于空间信息混合的 2D(逆)离散傅里叶变换。此外,我们凭经验发现,编码器(主干网络)应增强低频特征,而解码器(分割头)应增强高频特征。我们将其归因于编码器的语义信息提取作用和解码器的细粒度细节突出作用。因此,提出了低(高)频模块以适应这种情况。在流行的 DAVIS 和 YouTube-VOS 基准上的大量实验表明,GSFM 明显优于基线方法并取得了 SOTA 性能。此外,广泛的分析表明所提出的模块是合理的并具有很强的泛化能力。我们的源代码可在 https://github.com/workforai/GSFM 获取。

关键词

引用

@article{arxiv.2210.05567,
  title  = {Global Spectral Filter Memory Network for Video Object Segmentation},
  author = {Yong Liu and Ran Yu and Jiahao Wang and Xinyuan Zhao and Yitong Wang and Yansong Tang and Yujiu Yang},
  journal= {arXiv preprint arXiv:2210.05567},
  year   = {2022}
}

备注

ECCV2022