面向少样本视频目标分割的整体原型注意力网络
计算机视觉与模式识别
2023-07-18 v1
摘要
少样本视频目标分割(FSVOS)旨在借助一组包含像素级目标标注的支持图像,对未见类别的动态目标进行分割。已有方法表明,基于域代理的注意力机制通过学习支持图像与查询帧之间的相关性,在 FSVOS 中行之有效。然而,代理帧包含冗余的像素信息与背景噪声,导致分割性能不佳。此外,现有方法往往忽略查询视频中的帧间相关性。为缓解上述困境,我们提出一种整体原型注意力网络(HPAN)以推进 FSVOS。具体而言,HPAN 引入了原型图注意力模块(PGAM)与双向原型注意力模块(BPAM),将知识从已见类别迁移至未见类别。PGAM 从所有前景特征中生成局部原型,进而利用其内在相关性增强整体原型的表征。BPAM 通过融合协同注意力与自注意力,利用支持图像与视频帧的整体信息,以实现支持-查询语义一致性与帧内时间一致性。我们在 YouTube-FSVOS 上进行了大量实验,证明了所提 HPAN 方法的有效性与优越性。
引用
@article{arxiv.2307.07933,
title = {Holistic Prototype Attention Network for Few-Shot VOS},
author = {Yin Tang and Tao Chen and Xiruo Jiang and Yazhou Yao and Guo-Sen Xie and Heng-Tao Shen},
journal= {arXiv preprint arXiv:2307.07933},
year = {2023}
}
备注
accepted by IEEE Transactions on Circuits and Systems for Video Technology