中文

XMem++:基于少量标注帧的生产级视频分割

计算机视觉与模式识别 2023-08-16 v2 图形学

摘要

尽管用户引导的视频分割取得了进展,但对于高度复杂场景一致地提取复杂物体仍是一项劳动密集型任务,尤其对于生产环境。多数帧需要被标注的情况并不少见。我们提出一种新颖的半监督视频对象分割(SSVOS)模型 XMem++,它改进了现有的基于记忆的模型,引入了永久记忆模块。多数现有方法关注单帧标注,而我们的方法能有效处理同一物体或区域具有不同外观的多个用户选定帧。我们的方法能在保持所需标注帧数较低的同时提取高度一致的结果。我们进一步引入一种基于迭代与注意力的帧建议机制,用于计算下一最佳标注帧。我们的方法是实时的,且每次用户输入后无需重新训练。我们还引入一个新数据集 PUMaVOS,涵盖了先前基准中未见的新的挑战性用例。我们在具有挑战性的(部分与多类)分割场景以及长视频上展示了 SOTA 性能,同时确保标注帧数显著少于任何现有方法。项目页面:https://max810.github.io/xmem2-project-page/

关键词

引用

@article{arxiv.2307.15958,
  title  = {XMem++: Production-level Video Segmentation From Few Annotated Frames},
  author = {Maksym Bekuzarov and Ariana Bermudez and Joon-Young Lee and Hao Li},
  journal= {arXiv preprint arXiv:2307.15958},
  year   = {2023}
}

备注

Accepted to ICCV 2023. 18 pages, 16 figures