中文

面向动态视频的自适应人像抠图

计算机视觉与模式识别 2023-04-13 v1

摘要

视频抠图的最新研究致力于消除对 trimap 的依赖,因为 trimap 标注成本高昂且基于 trimap 的方法对实时应用的适应性较差。尽管最新的无 trimap 方法展现出有前景的结果,其在处理高度多样且非结构化的视频时性能常会下降。我们针对该局限提出了动态视频自适应抠图(AdaM),这是一个旨在同时区分前景与背景并捕捉前景人物 alpha 抠图细节的框架。为实现此目标采用了两个互联的网络设计:(1)一个编码-解码网络,生成 alpha 抠图与中间掩码,用于引导 transformer 自适应解码前景与背景;(2)一个 transformer 网络,其中长时与短时注意力相结合以保留空间与时间上下文,促进前景细节的解码。我们在近期提出的数据集上对所提方法进行了基准测试与研究,表明我们的模型在复杂真实世界视频中显著提升了抠图真实感与时间连贯性,并取得了新的最佳类间泛化能力。更多细节与示例见 https://github.com/microsoft/AdaM。

关键词

引用

@article{arxiv.2304.06018,
  title  = {Adaptive Human Matting for Dynamic Videos},
  author = {Chung-Ching Lin and Jiang Wang and Kun Luo and Kevin Lin and Linjie Li and Lijuan Wang and Zicheng Liu},
  journal= {arXiv preprint arXiv:2304.06018},
  year   = {2023}
}

备注

CVPR 2023