CAVIS:上下文感知视频实例分割
计算机视觉与模式识别
2025-07-10 v2
摘要
本文提出了上下文感知视频实例分割(CAVIS)框架,旨在通过整合每个对象相邻处的上下文信息来增强实例关联。为高效提取和利用此信息,我们提出了上下文感知实例跟踪器(CAIT),该跟踪器将实例周围的上下文数据与核心实例特征融合,以提高跟踪精度。此外,我们设计了原型跨帧对比(PCC)损失,确保对象级特征在帧之间保持一致,从而显著提升匹配精度。CAVIS在视频实例分割(VIS)和视频全景分割(VPS)的所有基准数据集上均优于最先进的方法。值得注意的是,我们的方法在尤为具有挑战性的OVIS数据集上表现尤为出色。项目页面:https://seung-hun-lee.github.io/projects/CAVIS/。
引用
@article{arxiv.2407.03010,
title = {CAVIS: Context-Aware Video Instance Segmentation},
author = {Seunghun Lee and Jiwan Seo and Kiljoon Han and Minwoo Choi and Sunghoon Im},
journal= {arXiv preprint arXiv:2407.03010},
year = {2025}
}
备注
ICCV 2025. Code: https://github.com/Seung-Hun-Lee/CAVIS