中文

面向视频目标分割的分层传播特征解耦

计算机视觉与模式识别 2022-11-29 v3

摘要

本文致力于为半监督视频目标分割(VOS)开发一种更有效的分层传播方法。基于视觉Transformer,近期提出的Associating Objects with Transformers(AOT)方法将分层传播引入VOS并取得了有前景的结果。分层传播能够逐步将信息从过去帧传播到当前帧,并将当前帧特征从与对象无关转换为对象特定。然而,对象特定信息的增加不可避免地会导致深层传播层中与对象无关的视觉信息丢失。为解决该问题并进一步促进视觉嵌入的学习,本文提出一种分层传播特征解耦(DeAOT)方法。首先,DeAOT通过在两个独立分支中处理与对象无关和对象特定的嵌入,解耦了二者的分层传播。其次,为补偿双分支传播带来的额外计算,我们提出了一种构建分层传播的高效模块,即门控传播模块(Gated Propagation Module),其通过单头注意力精心设计并构建。大量实验表明,DeAOT在准确率和效率上均显著优于AOT。在YouTube-VOS上,DeAOT可在22.4fps下达到86.0%,在53.4fps下达到82.0%。无需测试时增强,我们在四个基准上取得了新的最先进性能,即YouTube-VOS(86.2%)、DAVIS 2017(86.2%)、DAVIS 2016(92.9%)和VOT 2020(0.622)。项目页面:https://github.com/z-x-yang/AOT。

关键词

引用

@article{arxiv.2210.09782,
  title  = {Decoupling Features in Hierarchical Propagation for Video Object Segmentation},
  author = {Zongxin Yang and Yi Yang},
  journal= {arXiv preprint arXiv:2210.09782},
  year   = {2022}
}

备注

Accepted by NeurIPS 2022 (Spotlight)