中文

基于轨迹查询与提议的高效视频实例分割

计算机视觉与模式识别 2022-03-04 v1

摘要

视频实例分割(VIS)旨在对视频中的多个对象实例同时进行分类、分割和跟踪。近期的片段级 VIS 每次输入一个短视频片段,由于利用了多帧的更多时间上下文,表现出比帧级 VIS(分割即跟踪)更强的性能。然而,大多数片段级方法既非端到端可学习,也非实时。近期提出的 VIS Transformer(VisTR)通过在一个片段内端到端执行 VIS 解决了这些局限。但 VisTR 由于帧级密集注意力而训练时间长,且在多个视频片段中并非完全端到端可学习,因为它需要手工设计的数据关联来连接连续片段间的实例轨迹。本文提出 EfficientVIS,一种具有高效训练与推理的完全端到端框架。其核心是通过迭代的查询-视频交互来跨时空关联并分割感兴趣区域(RoIs)的轨迹查询与轨迹提议。我们进一步提出一种对应学习,使片段间的轨迹连接可端到端学习。与 VisTR 相比,EfficientVIS 所需的训练轮数减少 15 倍,同时在 YouTube-VIS 基准上取得最先进的精度。此外,我们的方法能够在单次端到端过程中完成整段视频的实例分割,完全无需数据关联。

关键词

引用

@article{arxiv.2203.01853,
  title  = {Efficient Video Instance Segmentation via Tracklet Query and Proposal},
  author = {Jialian Wu and Sudhir Yarram and Hui Liang and Tian Lan and Junsong Yuan and Jayan Eledath and Gerard Medioni},
  journal= {arXiv preprint arXiv:2203.01853},
  year   = {2022}
}

备注

Accepted to CVPR 2022