用于零样本视频目标分割的多源融合与自动预测器选择
计算机视觉与模式识别
2021-08-12 v1
摘要
位置和外观是视频目标分割的关键线索。许多源如 RGB、深度、光流和静态显著性可提供关于目标的有用信息。然而,现有方法仅利用 RGB 或 RGB 与光流。本文提出一种用于零样本视频目标分割的新型多源融合网络。借助内感受空间注意力模块(ISAM),各源的空间重要性被突出。此外,我们设计特征净化模块(FPM)以过滤源间不兼容特征。通过 ISAM 与 FPM,多源特征被有效融合。另外,我们提出自动预测器选择网络(APS),以选择静态显著性预测器或运动目标预测器中较优的预测,从而防止对由低质量光流图导致的失败结果过度依赖。在三个具挑战性的公开基准(即 DAVIS、Youtube-Objects 和 FBMS)上的大量实验表明,所提模型取得了优于当前最优方法的引人注目性能。源代码将公开于 \textcolor{red}{\url{https://github.com/Xiaoqi-Zhao-DLUT/Multi-Source-APS-ZVOS}}。
引用
@article{arxiv.2108.05076,
title = {Multi-Source Fusion and Automatic Predictor Selection for Zero-Shot Video Object Segmentation},
author = {Xiaoqi Zhao and Youwei Pang and Jiaxing Yang and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2108.05076},
year = {2021}
}
备注
This work was accepted as ACM MM 2021 oral