BATMAN: 运动-表观邻域空间中用于视频目标分割的双边注意力 Transformer
计算机视觉与模式识别
2022-08-09 v4
摘要
视频目标分割(VOS)是视频理解的基础任务。基于 Transformer 的方法在半监督 VOS 上展现出显著的性能提升。然而,现有工作在分割彼此邻近且视觉相似的目标时面临挑战。本文中,我们提出一种新颖的运动-表观邻域空间中的双边注意力 Transformer(BATMAN)用于半监督 VOS。它通过一种新颖的光流校准模块捕获视频中的目标运动,该模块将分割掩码与光流估计融合,以改善目标内部光流平滑性并降低目标边界处的噪声。随后,这一校准光流被用于我们新颖的双边注意力中,该注意力在邻域双边空间中同时考虑运动与表观来计算查询帧与参考帧之间的对应关係。大量实验验证了 BATMAN 架构的有效性:在全部四个流行 VOS 基准上均超越所有现有最优方法——Youtube-VOS 2019 (85.0%)、Youtube-VOS 2018 (85.3%)、DAVIS 2017Val/Testdev (86.2%/82.2%) 以及 DAVIS 2016 (92.5%)。
引用
@article{arxiv.2208.01159,
title = {BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation},
author = {Ye Yu and Jialin Yuan and Gaurav Mittal and Li Fuxin and Mei Chen},
journal= {arXiv preprint arXiv:2208.01159},
year = {2022}
}
备注
Accepted by ECCV 2022 (Oral)