面向零样本视频对象分割的自适应多源预测器
计算机视觉与模式识别
2024-02-06 v2
摘要
静态与运动物体常出现于现实视频中。大多数视频对象分割方法仅关注提取并利用运动线索来感知运动物体。一旦面对静态物体的帧,运动物体预测器可能因不确定的运动信息(如低质量光流图)而预测失败。此外,不同源如 RGB、深度、光流和静态显著性可提供关于物体的有用信息。然而,现有方法仅考虑 RGB 或 RGB 与光流。本文中,我们提出一种用于零样本视频对象分割(ZVOS)的新型自适应多源预测器。在静态物体预测器中,RGB 源被同时转换为深度与静态显著性源。在运动物体预测器中,我们提出多源融合结构。首先,借助内省空间注意力模块(ISAM)突出各源的空间重要性。其次,设计运动增强模块(MEM)以生成纯前景运动注意力,用于改进解码器中静态与运动特征的表示。此外,我们设计特征纯化模块(FPM)以过滤源间不兼容特征。通过使用 ISAM、MEM 和 FPM,多源特征被有效融合。另外,我们提出自适应预测器融合网络(APF)来评估光流图质量,并融合来自静态物体预测器与运动物体预测器的预测,以防止对低质量光流图所致失败结果的过度依赖。实验表明,所提模型在三个具挑战性的 ZVOS 基准上优于当前最优(SOTA)方法。并且,静态物体预测器可同时精确预测高质量深度图与静态显著性图。
引用
@article{arxiv.2303.10383,
title = {Adaptive Multi-source Predictor for Zero-shot Video Object Segmentation},
author = {Xiaoqi Zhao and Shijie Chang and Youwei Pang and Jiaxing Yang and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2303.10383},
year = {2024}
}
备注
Accepted to IJCV 2024. Code is available at: https://github.com/Xiaoqi-Zhao-DLUT/Multi-Source-APS-ZVOS. arXiv admin note: substantial text overlap with arXiv:2108.05076