基于 Mask R-CNN 的人体提取与场景转换
计算机视觉与模式识别
2019-10-29 v2 图形学
摘要
目标检测是计算机视觉中一个热门的分支,尤其在人体识别与行人检测方面。识别一个人的完整身体一直是一个难题。多年来,研究者提出了各种方法,最近 Mask R-CNN 在实例分割上取得了突破。基于 Faster R-CNN,Mask R-CNN 已能够为每一个实例生成分割掩码。我们提出一种应用,从图像和视频中提取多个人体,用于愉悦的生活场景,以将家人、朋友及社区等人们的欢乐时刻汇聚起来,服务于 QOL(生活质量)。我们还提出了一种将提取出的人体图像放入新背景的方法。这使得用户能够制作其生活中家人及朋友愉快表情与动作的集合。Mask R-CNN 从图像中检测出所有类型的物体掩码。随后我们的算法仅考虑目标人物,并在无遮挡(如人物前方有狗)的情况下仅提取人物,用户也可按期望选择多个人物。我们的算法对图像和视频均有效,与视频长度无关。我们的算法未给 Mask R-CNN 增加任何开销,以 5 fps 运行。我们展示了图像中瑜伽者和舞蹈视频帧中舞者的例子。我们希望这一简单而有效的方法可作为替换图像背景的基线,并有助于简化未来研究。
引用
@article{arxiv.1907.08884,
title = {Human Extraction and Scene Transition utilizing Mask R-CNN},
author = {Asati Minkesh and Kraittipong Worranitta and Miyachi Taizo},
journal= {arXiv preprint arXiv:1907.08884},
year = {2019}
}
备注
6 pages, 10 figures