中文

DeVIS:使可变形Transformer适用于视频实例分割

计算机视觉与模式识别 2022-07-25 v1 机器学习 机器人学

摘要

视频实例分割(VIS)联合处理视频序列中的多目标检测、跟踪与分割。过去,VIS 方法在架构设计上映射了这些子任务的碎片化,因而错失联合解。Transformer 近期使得将整个 VIS 任务视为单一集合预测问题成为可能。然而,现有基于 Transformer 方法的二次复杂度需要长训练时间、高内存需求及低单尺度特征图处理。可变形注意力提供了更高效替代,但其在时域或分割任务的应用尚未被探索。本工作中,我们提出 Deformable VIS (DeVIS),一种利用可变形 Transformer 的效率与性能的 VIS 方法。为跨多帧联合推理所有 VIS 子任务,我们提出带实例感知目标查询的时域多尺度可变形注意力。我们进一步引入具多尺度特征的新图像与视频实例掩码头,并以多线索片段跟踪执行近在线视频处理。DeVIS 降低了内存与训练时间需求,并在 YouTube-VIS 2021 及具挑战性的 OVIS 数据集上取得最先进结果。代码见 https://github.com/acaelles97/DeVIS。

关键词

引用

@article{arxiv.2207.11103,
  title  = {DeVIS: Making Deformable Transformers Work for Video Instance Segmentation},
  author = {Adrià Caelles and Tim Meinhardt and Guillem Brasó and Laura Leal-Taixé},
  journal= {arXiv preprint arXiv:2207.11103},
  year   = {2022}
}