中文

面向在线视频实例分割的混合实例感知时序融合方法

计算机视觉与模式识别 2022-06-08 v2

摘要

近来,基于transformer的图像分割方法相较以往方案取得了显著成功。而在视频领域,如何借助跨帧目标实例的注意力有效建模时序上下文仍是一个开放问题。本文提出一种具有新颖实例感知时序融合方法的在线视频实例分割框架。我们首先利用全局上下文中的潜码(实例码)与CNN特征图来表示实例级与像素级特征。基于此表示,我们引入一种无裁剪的时序融合方法来建模视频帧间的时序一致性。具体而言,我们在实例码中编码全局实例特定信息,并通过实例码与CNN特征图之间的混合注意力建立帧间上下文融合。实例码之间的帧间一致性进一步由顺序约束加以强化。借助所学习的混合时序一致性,我们可直接跨帧检索并维持实例身份,消除了以往方法中复杂的逐帧实例匹配。我们在流行的VIS数据集即Youtube-VIS-19/21上进行了充分实验。我们的模型在所有在线VIS方法中取得最佳性能。值得注意的是,在使用ResNet-50骨干时,我们的模型也超越了所有离线方法。

关键词

引用

@article{arxiv.2112.01695,
  title  = {Hybrid Instance-aware Temporal Fusion for Online Video Instance Segmentation},
  author = {Xiang Li and Jinglu Wang and Xiao Li and Yan Lu},
  journal= {arXiv preprint arXiv:2112.01695},
  year   = {2022}
}

备注

AAAI 2022