中文

通过上下文聚合与强数据增强提升图像抠图的鲁棒性

计算机视觉与模式识别 2022-01-19 v1

摘要

深度图像抠图方法在基准(如 Composition-1k/alphamatting.com)上已取得越来越好的结果。然而,其鲁棒性,包括对 trimap 的鲁棒性以及向不同域图像的泛化能力,仍待探索。尽管一些工作提出精炼 trimap 或通过额外数据增强使算法适配真实图像,但无一同时考虑两者,更毋庸说使用那些数据增强时基准上的显著性能退化。为填补此空白,我们提出一种通过多级上下文聚合与针对抠图的强数据增强实现更高鲁棒性(RMat)的图像抠图方法。具体而言,我们首先在编码器中用 transformer 模块建模充分全局信息,并在解码器中结合卷积层与低层特征聚合注意力模块聚焦于细节,从而构建强抠图框架。然后,基于此强基线,我们分析当前数据增强并探索简单但有效的强数据增强以提升基线模型,贡献更具泛化性的抠图方法。相较先前方法,所提方法不仅以更小模型规模在 Composition-1k 基准上取得 SOTA 结果(SAD 提升11%、Grad 提升27%),也在其他基准、真实图像及我们大量实验中 varying coarse-to-fine trimap 上展现出更鲁棒的泛化结果。

关键词

引用

@article{arxiv.2201.06889,
  title  = {Boosting Robustness of Image Matting with Context Assembling and Strong Data Augmentation},
  author = {Yutong Dai and Brian Price and He Zhang and Chunhua Shen},
  journal= {arXiv preprint arXiv:2201.06889},
  year   = {2022}
}

备注

19 pages