一种用于视频实例分割的通用框架
计算机视觉与模式识别
2023-03-27 v2
摘要
处理具有复杂和遮挡序列的长视频近来已成为视频实例分割(VIS)领域的新挑战。然而,现有方法在应对该挑战时存在局限。我们认为当前方法的最大瓶颈在于训练与推理之间的不一致。为有效弥合这一差距,我们提出了一种用于 VIS 的通用框架,即 GenVIS,其在具挑战性的基准上取得了最先进的性能,而无需设计复杂架构或额外后处理。GenVIS 的关键贡献在于其学习策略,包括用于序列学习的基于查询的训练流程以及一种新颖的目标标签分配。此外,我们引入了能有效从先前状态获取信息的记忆机制。得益于关注建立独立帧或片段间关系的新视角,GenVIS 可灵活地以在线和半在线方式执行。我们在流行的 VIS 基准上评估了我们的方法,在 YouTube-VIS 2019/2021/2022 和 Occluded VIS(OVIS)上取得了最先进的结果。值得注意的是,我们在长 VIS 基准(OVIS)上大幅超越最先进水平,以 ResNet-50 骨干网络提升了 5.6 AP。代码见 https://github.com/miranheo/GenVIS。
引用
@article{arxiv.2211.08834,
title = {A Generalized Framework for Video Instance Segmentation},
author = {Miran Heo and Sukjun Hwang and Jeongseok Hyun and Hanjung Kim and Seoung Wug Oh and Joon-Young Lee and Seon Joo Kim},
journal= {arXiv preprint arXiv:2211.08834},
year = {2023}
}
备注
CVPR 2023