混合现实中视频自化身用的实时第一人称分割
计算机视觉与模式识别
2022-07-05 v1
摘要
本工作提出我们的实时第一人称身体分割算法。受Thundernet架构启发采用浅层网络,我们的算法在640x480输入分辨率下达到66 fps帧率。此外,我们高度重视训练数据的多样性。更具体地,我们描述了Egocentric Bodies(EgoBodies)数据集的创建过程,该集由来自三个数据集的近10,000张图像组成,通过合成方法与真实捕获共同构建。我们开展实验以理解各单独数据集的贡献;将用EgoBodies训练的Thundernet模型与更简易及更复杂的已有方法比较,并讨论它们在真实场景设置下于分割质量与推理时间方面的相应表现。所述训练好的语义分割算法已集成于混合现实(MR)端到端系统中,使用户在沉浸于MR场景时能看到其自身身体。
引用
@article{arxiv.2207.01296,
title = {Real Time Egocentric Segmentation for Video-self Avatar in Mixed Reality},
author = {Ester Gonzalez-Sosa and Andrija Gajic and Diego Gonzalez-Morin and Guillermo Robledo and Pablo Perez and Alvaro Villegas},
journal= {arXiv preprint arXiv:2207.01296},
year = {2022}
}
备注
9 pages, 9 figures