注意力引导的时间相干视频对象抠图
计算机视觉与模式识别
2021-07-30 v3
摘要
本文提出一种新颖的基于深度学习的视频对象抠图方法,能够获得时间相干的抠图结果。其关键组件是一个基于注意力的时序聚合模块,该模块将图像抠图网络的优势最大化地赋予视频抠图网络。该模块在特征空间中计算沿时间轴彼此相邻的像素的时序相关性,对运动噪声具有鲁棒性。我们还设计了一种新颖的损失项来训练注意力权重,大幅提升了视频抠图性能。此外,我们展示了如何通过用稀疏的用户标注关键帧微调最先进的视频对象分割网络,来有效解决三元图生成问题。为促进视频抠图与三元图生成网络的训练,我们构建了一个大规模视频抠图数据集,包含 80 个训练与 28 个验证前景视频片段及对应的真值 alpha 抠图。实验结果表明,我们的方法能为具有外观变化、遮挡和快速运动的各类视频生成高质量 alpha 抠图。我们的代码与数据集可在 https://github.com/yunkezhang/TCVOM 获取。
引用
@article{arxiv.2105.11427,
title = {Attention-guided Temporally Coherent Video Object Matting},
author = {Yunke Zhang and Chi Wang and Miaomiao Cui and Peiran Ren and Xuansong Xie and Xian-sheng Hua and Hujun Bao and Qixing Huang and Weiwei Xu},
journal= {arXiv preprint arXiv:2105.11427},
year = {2021}
}
备注
10 pages, 6 figures, MM '21 camera-ready