PP-HumanSeg:基于大规模视频会议数据集的连通性感知人像分割
计算机视觉与模式识别
2021-12-15 v1 机器学习
摘要
随着 COVID-19 疫情在全球蔓延,视频会议需求激增。为此,实时人像分割成为替换会议参与者背景的流行功能。尽管已有丰富的数据集、模型和算法用于从生活场景中提取身体姿态的分割,但视频会议场景下的人像分割尚未得到充分覆盖。为推动该领域进展,我们提出一个名为 PP-HumanSeg 的开源方案。本工作首次构建了大规模视频人像数据集,包含来自 23 个会议场景的 291 段视频、14K 精细标注帧,并扩展至多摄像头视频会议。此外,我们提出一种用于语义分割的新颖语义连通性感知学习(SCL),其引入语义连通性感知损失,从连通性角度提升分割结果质量。我们还提出一种结合 SCL 的超轻量模型用于实用人像分割,在 IoU 与推理速度间取得最佳权衡。在我们数据集上的大量评估证明了 SCL 及我们模型的优越性。源代码见 https://github.com/PaddlePaddle/PaddleSeg。
引用
@article{arxiv.2112.07146,
title = {PP-HumanSeg: Connectivity-Aware Portrait Segmentation with a Large-Scale Teleconferencing Video Dataset},
author = {Lutao Chu and Yi Liu and Zewu Wu and Shiyu Tang and Guowei Chen and Yuying Hao and Juncai Peng and Zhiliang Yu and Zeyu Chen and Baohua Lai and Haoyi Xiong},
journal= {arXiv preprint arXiv:2112.07146},
year = {2021}
}
备注
Accepted by WACV workshop