MDQE:挖掘判别性查询嵌入以分割困难视频中的遮挡实例
计算机视觉与模式识别
2023-03-28 v1
摘要
尽管已取得令人瞩目的进展,采用逐片段输入的视频实例分割(VIS)方法在包含遮挡物体和拥挤场景的困难视频上往往表现不佳。这主要是因为这类方法中的实例查询无法很好地编码实例的判别性嵌入,使得基于查询的分割器难以区分那些“困难”实例。为解决这些问题,我们提出挖掘判别性查询嵌入(MDQE)来分割困难视频中的遮挡实例。首先,我们通过考虑空间上下文信息和帧间物体运动来初始化物体查询的位置嵌入与内容特征。其次,我们提出实例间掩码排斥损失,使每个实例与其邻近的非目标实例相远离。所提出的 MDQE 是首个采用逐片段输入且在困难视频上取得最先进(SOTA)结果、在简单视频上具有竞争力表现的 VIS 方法。具体而言,基于 ResNet50 的 MDQE 在 OVIS 和 YouTube-VIS 2021 上分别取得 33.0% 和 44.5% 的掩码 AP。MDQE 的代码见 \url{https://github.com/MinghanLi/MDQE_CVPR2023}。
引用
@article{arxiv.2303.14395,
title = {MDQE: Mining Discriminative Query Embeddings to Segment Occluded Instances on Challenging Videos},
author = {Minghan Li and Shuai Li and Wangmeng Xiang and Lei Zhang},
journal= {arXiv preprint arXiv:2303.14395},
year = {2023}
}