中文

MinVIS:无需基于视频训练的最小化视频实例分割框架

计算机视觉与模式识别 2022-08-04 v1 人工智能

摘要

我们提出 MinVIS,一种最小的视频实例分割(VIS)框架,其在既无基于视频的架构也无基于视频的训练流程的情况下实现了最先进的 VIS 性能。仅通过训练基于查询的图像实例分割模型,MinVIS 在具有挑战性的 Occluded VIS 数据集上以超过 10% AP 优于先前最佳结果。由于 MinVIS 将训练视频中的帧视为独立图像,我们可以大幅子采样训练视频中的标注帧而无需任何修改。仅使用 1% 的标注帧,MinVIS 在 YouTube-VIS 2019/2021 上优于或可与全监督最先进方法相媲美。我们的关键观察是,训练为帧内物体实例间可判别的查询具有时间一致性,并可用于跟踪实例而无需任何手动设计的启发式方法。因此 MinVIS 具有以下推理流程:我们首先将训练好的基于查询的图像实例分割独立地应用于视频帧。随后通过对应查询的二分匹配来跟踪分割出的实例。该推理以在线方式进行,无需一次性处理整个视频。因此 MinVIS 具有降低标注成本与内存需求的实用优势,同时不牺牲 VIS 性能。代码见:https://github.com/NVlabs/MinVIS

关键词

引用

@article{arxiv.2208.02245,
  title  = {MinVIS: A Minimal Video Instance Segmentation Framework without Video-based Training},
  author = {De-An Huang and Zhiding Yu and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2208.02245},
  year   = {2022}
}