RefineVIS:基于时间注意力细化的视频实例分割
计算机视觉与模式识别
2023-06-09 v1
摘要
我们提出一种名为 RefineVIS 的视频实例分割(VIS)新框架,通过利用序列上下文迭代细化表征,实现帧间良好的目标关联与精确的分割掩码。RefineVIS 在现成的帧级图像实例分割模型之上学习两种独立表征:负责跨帧目标关联的关联表征,以及生成精确分割掩码的分隔表征。对比学习用于学习时间稳定的关联表征。时间注意力细化(TAR)模块通过利用时间关系与一种新颖的时间对比去噪技术学习有判别力的分割表征。我们的方法支持在线与离线推理,在 YouTube-VIS 2019(64.4 AP)、YouTube-VIS 2021(61.4 AP)与 OVIS(46.1 AP)数据集上取得了最先进的视频实例分割精度。可视化表明 TAR 模块可生成更精确的实例分割掩码,尤其针对高度遮挡目标等挑战性情形。
引用
@article{arxiv.2306.04774,
title = {RefineVIS: Video Instance Segmentation with Temporal Attention Refinement},
author = {Andre Abrantes and Jiang Wang and Peng Chu and Quanzeng You and Zicheng Liu},
journal= {arXiv preprint arXiv:2306.04774},
year = {2023}
}