中文

UniVS:以提示为查询的统一通用视频分割

计算机视觉与模式识别 2024-06-11 v2 计算与语言

摘要

尽管统一图像分割(IS)最近取得了进展,但开发统一的视频分割(VS)模型仍然是一个挑战。这主要是因为通用的类别指定VS任务需要检测所有对象并在连续帧中跟踪它们,而提示引导的VS任务则需要在整个视频中通过视觉/文本提示重新识别目标,这使得难以用相同的架构处理不同的任务。我们尝试解决这些问题,并提出了一种新颖的统一VS架构,即UniVS,通过使用提示作为查询。UniVS将来自先前帧的目标提示特征平均作为其初始查询,以显式解码掩码,并在掩码解码器中引入目标级提示交叉注意力层,以集成记忆池中的提示特征。通过将来自先前帧的实体预测掩码作为其视觉提示,UniVS将不同的VS任务转换为提示引导的目标分割,消除了启发式的帧间匹配过程。我们的框架不仅统一了不同的VS任务,而且自然地实现了通用训练和测试,确保了在不同场景下的鲁棒性能。UniVS在10个具有挑战性的VS基准测试中展示了性能与通用性之间的良好平衡,涵盖了视频实例、语义、全景、对象和指代分割任务。代码可在\url{https://github.com/MinghanLi/UniVS}找到。

关键词

引用

@article{arxiv.2402.18115,
  title  = {UniVS: Unified and Universal Video Segmentation with Prompts as Queries},
  author = {Minghan Li and Shuai Li and Xindong Zhang and Lei Zhang},
  journal= {arXiv preprint arXiv:2402.18115},
  year   = {2024}
}

备注

21 pages, 11 figures, 10 tabels, CVPR2024