面向复杂视频场景的实时以人为中心的分割
计算机视觉与模式识别
2021-08-17 v1
摘要
大多数现有的与“人”相关的视频任务都聚焦于显著人物的分割,忽略了视频中未指定的其他人。很少有研究关注于在复杂视频中分割并跟踪所有人类,包括行人和处于其他状态的人(如坐姿、骑行或被遮挡)。在本文中,我们提出了一种新颖的框架,缩写为 HVISNet,它基于单阶段检测器对给定视频中所有出现的人进行分割与跟踪。为了更好地评估复杂场景,我们提供了一个称为 HVIS(Human Video Instance Segmentation,人体视频实例分割)的新基准,其包含来自 805 个多样场景高分辨率视频中的 1447 个人体实例掩码。大量实验表明,我们提出的 HVISNet 在实时推理速度(30 FPS)下于准确性方面优于最先进的方法,尤其在复杂视频场景中。我们还注意到,使用边界框中心来区分不同个体会严重降低分割精度,特别是在严重遮挡条件下。这一常见现象被称为模糊正样本问题。为缓解该问题,我们提出了一种称为内部中心采样(Inner Center Sampling)的机制以提高实例分割的准确性。这种即插即用的内部中心采样机制可集成到任何基于单阶段检测器的实例分割模型中以提升性能。特别地,在遮挡人的情况下,它在最先进方法上获得了 4.1 mAP 的提升。代码与数据可在 https://github.com/IIGROUP/HVISNet 获取。
引用
@article{arxiv.2108.07199,
title = {Real-time Human-Centric Segmentation for Complex Video Scenes},
author = {Ran Yu and Chenyu Tian and Weihao Xia and Xinyuan Zhao and Haoqian Wang and Yujiu Yang},
journal= {arXiv preprint arXiv:2108.07199},
year = {2021}
}