中文

用于少样本视频对象分割的多粒度时间原型学习

计算机视觉与模式识别 2023-09-21 v1

摘要

少样本视频对象分割(FSVOS)旨在用少量标注支持图像所定义的同一类别,对查询视频中的对象进行分割。然而,该任务鲜有探索。在本工作中,基于 IPMT(一种结合外部支持引导信息与自适应查询引导线索的最先进少样本图像分割方法),我们提出利用多粒度时间引导信息来处理视频数据的时间相关性本质。我们将查询视频信息分解为片段原型与记忆原型,分别用于捕获局部与长期内部时间引导。帧原型进一步被每帧独立使用,以处理细粒度自适应引导并实现双向片段-帧原型通信。为降低噪声记忆的影响,我们提出利用不同预测区域与支持之间的结构相似性关系来筛选可靠记忆帧。此外,还提出了一种新的分割损失以增强所学原型的类别可分辨性。实验结果表明,我们提出的视频 IPMT 模型在两个基准数据集上显著优于先前模型。代码见 https://github.com/nankepan/VIPMT。

关键词

引用

@article{arxiv.2309.11160,
  title  = {Multi-grained Temporal Prototype Learning for Few-shot Video Object Segmentation},
  author = {Nian Liu and Kepan Nan and Wangbo Zhao and Yuanwei Liu and Xiwen Yao and Salman Khan and Hisham Cholakkal and Rao Muhammad Anwer and Junwei Han and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2309.11160},
  year   = {2023}
}

备注

ICCV 2023