中文

基于时空对齐与聚合的深度视频抠像

计算机视觉与模式识别 2021-04-23 v1

摘要

尽管深度学习在自然图像抠像方面取得了显著进展,但由于推理时间域的内在技术挑战以及缺乏大规模视频抠像数据集,迄今为止尚无代表性的深度学习视频抠像工作。本文中,我们提出了一种基于深度学习的视频抠像框架,其采用了新颖有效的时空特征聚合模块(ST-FAM)。由于光流估计在抠像区域内可能非常不可靠,ST-FAM 被设计用于在网络解码器内跨不同空间尺度与时间帧有效对齐并聚合信息。为消除逐帧 trimap 标注,我们还引入了轻量交互式 trimap 传播网络。另一贡献在于一个带有真实 alpha 抠像图的大规模视频抠像数据集,用于定量评估,以及带有 trimap 的真实高分辨率视频用于定性评估。定量与定性实验结果表明,在存在多帧时间信息的情况下,我们的框架显著优于应用于视频的传统视频抠像与深度图像抠像方法。

关键词

引用

@article{arxiv.2104.11208,
  title  = {Deep Video Matting via Spatio-Temporal Alignment and Aggregation},
  author = {Yanan Sun and Guanzhi Wang and Qiao Gu and Chi-Keung Tang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2104.11208},
  year   = {2021}
}