面向无监督视频目标分割的双原型注意力
计算机视觉与模式识别
2024-03-27 v3
摘要
无监督视频目标分割(VOS)旨在检测并分割视频中最显著的目标。无监督 VOS 使用的主要技术有:1)外观与运动信息的协作;2)不同帧间的时间融合。本文提出两种新颖的基于原型的注意力机制,即模态间注意力(IMA)和帧间注意力(IFA),通过跨不同模态和帧的密集传播来融合这些技术。IMA 基于相互精炼,密集整合来自不同模态的上下文信息。IFA 将视频的全局上下文注入查询帧,从而充分利用多帧的有用属性。在公开基准数据集上的实验结果表明,我们提出的方法大幅优于所有现有方法。所提出的两个组件也通过消融研究得到了充分验证。
引用
@article{arxiv.2211.12036,
title = {Dual Prototype Attention for Unsupervised Video Object Segmentation},
author = {Suhwan Cho and Minhyeok Lee and Seunghoon Lee and Dogyoon Lee and Heeseung Choi and Ig-Jae Kim and Sangyoun Lee},
journal= {arXiv preprint arXiv:2211.12036},
year = {2024}
}
备注
CVPR 2024