中文

面向少样本视频目标分割的整体原型注意力网络

计算机视觉与模式识别 2023-07-18 v1

摘要

少样本视频目标分割(FSVOS)旨在借助一组包含像素级目标标注的支持图像,对未见类别的动态目标进行分割。已有方法表明,基于域代理的注意力机制通过学习支持图像与查询帧之间的相关性,在 FSVOS 中行之有效。然而,代理帧包含冗余的像素信息与背景噪声,导致分割性能不佳。此外,现有方法往往忽略查询视频中的帧间相关性。为缓解上述困境,我们提出一种整体原型注意力网络(HPAN)以推进 FSVOS。具体而言,HPAN 引入了原型图注意力模块(PGAM)与双向原型注意力模块(BPAM),将知识从已见类别迁移至未见类别。PGAM 从所有前景特征中生成局部原型,进而利用其内在相关性增强整体原型的表征。BPAM 通过融合协同注意力与自注意力,利用支持图像与视频帧的整体信息,以实现支持-查询语义一致性与帧内时间一致性。我们在 YouTube-FSVOS 上进行了大量实验,证明了所提 HPAN 方法的有效性与优越性。

关键词

引用

@article{arxiv.2307.07933,
  title  = {Holistic Prototype Attention Network for Few-Shot VOS},
  author = {Yin Tang and Tao Chen and Xiruo Jiang and Yazhou Yao and Guo-Sen Xie and Heng-Tao Shen},
  journal= {arXiv preprint arXiv:2307.07933},
  year   = {2023}
}

备注

accepted by IEEE Transactions on Circuits and Systems for Video Technology