CRISP:对比残差注入与语义提示的持续视频实例分割
计算机视觉与模式识别
2025-08-15 v1
摘要
持续视频实例分割需要具备吸收新目标类别的柔性,同时保持对以前学习任务的稳定性,并在帧之间维持时间一致性。本文引入对比残差注入与语义提示(CRISP),旨在解决持续视频实例分割中针对实例、类别和任务三个层面的混淆问题。对于实例学习,我们建模实例跟踪并构建实例相关性损失,强调与先前查询空间的相关性,同时强化当前任务查询的特定性。对于类别学习,我们构建自适应残差语义提示(ARSP)学习框架,构造由类别文本生成的可学习语义残差提示池,并引入可调查询-提示匹配机制,在当前任务查询与语义残差提示之间建立映射关系。同时引入基于对比学习的语义一致性损失,以保持对象查询与残差提示在增量训练期间的语义连贯性。对于任务学习,为确保查询空间中跨任务层面的相关性,我们引入一种简洁而强大的增量提示初始化策略。在 YouTube-VIS-2019 和 YouTube-VIS-2021 数据集上进行大量实验,表明 CRISP 在长期持续视频实例分割任务中显著优于现有方法,避免了灾难性遗忘,并有效提升了分割和分类性能。代码已公开 https://github.com/01upup10/CRISP。
引用
@article{arxiv.2508.10432,
title = {CRISP: Contrastive Residual Injection and Semantic Prompting for Continual Video Instance Segmentation},
author = {Baichen Liu and Qi Lyu and Xudong Wang and Jiahua Dong and Lianqing Liu and Zhi Han},
journal= {arXiv preprint arXiv:2508.10432},
year = {2025}
}