面向不平衡运动:用于视频人像分割的部件解耦网络
计算机视觉与模式识别
2024-07-03 v2
摘要
视频人像分割(VPS)旨在从视频帧中分割出显著的前景人像,近年来受到广泛关注。然而,现有 VPS 数据集的简单性导致该任务的深入研究受到限制。在本文中,我们提出了一个新颖的复杂大规模多场景视频人像分割数据集 MVPS,包含 7 个场景类别的 101 个视频片段,其中 10,843 帧采样帧在像素级别进行了精细标注。该数据集具有多样的场景和复杂的背景环境,据我们所知是 VPS 中最复杂的数据集。通过在数据集构建过程中对大量含人像视频的观察,我们发现由于人体的关节结构,人像的运动是部件关联的,这导致不同部件在运动上相对独立。即人像不同部件的运动是不平衡的。针对这种不平衡,一个直观且合理的想法是,通过将人像解耦为部件,可以更好地利用人像中不同的运动状态。为此,我们提出了一种用于视频人像分割的部件解耦网络(PDNet)。具体而言,提出了帧间部件判别注意力(IPDA)模块,该模块无监督地将人像分割为部件,并对指定给每个不同部件的判别性特征施加不同的注意力。通过这种方式,可以对具有不平衡运动的人像部件施加适当的注意力以提取部件判别相关性,从而更准确地分割人像。实验结果证明,与最先进的方法相比,我们的方法取得了领先的性能。
引用
@article{arxiv.2307.16565,
title = {Towards Imbalanced Motion: Part-Decoupling Network for Video Portrait Segmentation},
author = {Tianshu Yu and Changqun Xia and Jia Li},
journal= {arXiv preprint arXiv:2307.16565},
year = {2024}
}