中文

基于深度运动建模的区域感知视频对象分割

计算机视觉与模式识别 2022-07-22 v1

摘要

当前的半监督视频对象分割(VOS)方法通常利用一帧的完整特征来预测对象掩码并更新记忆,这引入了显著的冗余计算。为降低冗余,我们提出一种区域感知视频对象分割(RAVOS)方法,该方法预测感兴趣区域(ROIs)以实现高效的对象分割与记忆存储。RAVOS 包含一个快速对象运动跟踪器,用于预测其在下一帧中的 ROIs。为实现高效分割,根据 ROIs 提取对象特征,并设计对象解码器用于对象级分割。为实现高效记忆存储,我们提出运动路径记忆,通过记忆两帧之间对象运动路径内的特征来过滤冗余上下文。除 RAVOS 外,我们还提出一个大规模数据集,称为 OVOS,用于在遮挡下评测 VOS 模型的性能。在 DAVIS 和 YouTube-VOS 基准以及我们的新 OVOS 数据集上的评估表明,我们的方法以显著更快的推理时间取得了最先进的性能,例如在 DAVIS 上以 42 FPS 达到 86.1 J&F,在 YouTube-VOS 上以 23 FPS 达到 84.4 J&F。

关键词

引用

@article{arxiv.2207.10258,
  title  = {Region Aware Video Object Segmentation with Deep Motion Modeling},
  author = {Bo Miao and Mohammed Bennamoun and Yongsheng Gao and Ajmal Mian},
  journal= {arXiv preprint arXiv:2207.10258},
  year   = {2022}
}