基于层次化视觉提示学习的持续视频实例分割
计算机视觉与模式识别
2025-08-13 v1
摘要
视频实例分割 (VIS) 因其在视频帧上跟踪和分割对象实例的能力而受到广泛关注。然而,现有大多数 VIS 方法不切实际地假设对象实例的类别在时间上保持固定。此外,它们在需要持续学习属于新类别的对象实例时会忘记旧类别。为解决这些挑战,我们开发了一种新的层次化视觉提示学习 (Hierarchical Visual Prompt Learning, HVPL) 模型,从帧级和视频级两个角度克服旧类别的灾难性遗忘。具体而言,为缓解帧级遗忘,我们设计了任务特定的帧级提示和正交梯度校正 (OGC) 模块。OGC 模块通过将其梯度投影到旧类别的正交特征空间,从而帮助帧级提示为每个 individual frame 中的新类别编码任务特定的全局实例信息。此外,为解决视频级遗忘,我们设计了任务特定的视频提示和视频上下文解码器。该解码器首先将帧之间结构化的类别间关系嵌入到帧级提示特征中,然后将任务特定的全局视频上下文从帧级提示特征传递到视频提示中。通过严格的比较,我们的 HVPL 模型证明比基线方法更有效。代码已公开于 https://github.com/JiahuaDong/HVPL。
引用
@article{arxiv.2508.08612,
title = {Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation},
author = {Jiahua Dong and Hui Yin and Wenqi Liang and Hanbin Zhao and Henghui Ding and Nicu Sebe and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2508.08612},
year = {2025}
}
备注
Accepted to ICCV2025