中文

具有灵活引导输入的深度图像抠图

计算机视觉与模式识别 2021-10-22 v1 机器学习

摘要

图像抠图是一个重要的计算机视觉问题。许多现有的抠图方法需要手工制作的 trimap 来提供辅助信息,这非常昂贵并限制了实际世界中的使用。近来,一些无 trimap 的方法被提出,其完全摆脱了任何用户输入。然而,由于缺乏引导信息,它们的性能远远落后于基于 trimap 的方法。在本文中,我们提出一种使用灵活引导输入(Flexible Guidance Input)作为用户提示的抠图方法,这意味着我们的方法可以使用 trimap、涂鸦图(scribblemap)或点击图(clickmap)作为引导信息,甚至可以在没有任何引导输入的情况下工作。为此,我们提出渐进式 trimap 变形(PTD)方案,随着训练步数增加逐渐收缩 trimap 的前景和背景区域,最终变为涂鸦图。为使我们的网络对任意用户涂鸦和点击具有鲁棒性,我们在前景和背景上随机采样点并进行曲线拟合。此外,我们提出语义融合模块(SFM),首次在抠图任务中利用特征金字塔增强模块(FPEM)和联合金字塔上采样(JPU)。实验表明,与现有的基于 trimap 和无 trimap 的方法相比,我们的方法可以达到最先进的结果。

关键词

引用

@article{arxiv.2110.10898,
  title  = {Deep Image Matting with Flexible Guidance Input},
  author = {Hang Cheng and Shugong Xu and Xiufeng Jiang and Rongrong Wang},
  journal= {arXiv preprint arXiv:2110.10898},
  year   = {2021}
}

备注

Accepted to BMVC2021