MODNet-V:通过背景恢复改进人像视频抠图
计算机视觉与模式识别
2021-09-27 v1
摘要
为更精确地解决困难的人像视频抠图问题,现有工作通常施加一些需要额外用户付出的抠图先验,如标注的三元图或背景图像。本工作中,我们观察到,与其要求用户显式提供背景图像,不如从输入视频自身恢复之。为此,我们首先提出一种新颖的背景恢复模块(BRM),从输入视频动态恢复背景图像。BRM极为轻量,可轻松集成至现有抠图模型。通过将BRM与近期图像抠图模型MODNet结合,我们进而提出用于人像视频抠图的MODNet-V。得益于BRM提供的强背景先验,MODNet-V仅具MODNet三分之一的参数却取得相当甚至更优的性能。我们的设计使MODNet-V可在单块NVIDIA 3090 GPU上以端到端方式训练。最后,我们引入一种新的块细化模块(PRM),使MODNet-V适配高分辨率视频,同时保持轻量与快速。
引用
@article{arxiv.2109.11818,
title = {MODNet-V: Improving Portrait Video Matting via Background Restoration},
author = {Jiayu Sun and Zhanghan Ke and Lihe Zhang and Huchuan Lu and Rynson W. H. Lau},
journal= {arXiv preprint arXiv:2109.11818},
year = {2021}
}