中文

用于通用图像抠图的双上下文聚合

计算机视觉与模式识别 2024-02-29 v1

摘要

自然图像抠图旨在从给定图像中估计前景的 alpha 遮罩。人们已探索了多种方法来解决这一问题,例如使用点击或三值图(trimap)等引导的交互式抠图方法,以及针对特定对象的自动抠图方法。然而,现有的抠图方法是为特定对象或引导设计的,忽视了图像抠图中聚合全局和局部上下文的共同需求。因此,这些方法在准确识别前景和生成精确边界方面经常遇到挑战,限制了其在不可预见场景中的有效性。在本文中,我们提出了一种简单且通用的抠图框架,名为双上下文聚合抠图(DCAM),它能够利用任意引导或无引导进行鲁棒的图像抠图。具体而言,DCAM 首先采用语义骨干网络从输入图像和引导中提取低级特征和上下文特征。然后,我们引入了一种双上下文聚合网络,该网络结合了全局对象聚合器和局部外观聚合器,以迭代细化提取的上下文特征。通过执行全局轮廓分割和局部边界细化,DCAM 表现出对多种类型引导和对象的鲁棒性。最后,我们采用抠图解码器网络融合低级特征和细化的上下文特征以进行 alpha 遮罩估计。在五个抠图数据集上的实验结果表明,所提出的 DCAM 在自动抠图和交互式抠图任务中均优于最先进的抠图方法,突显了 DCAM 强大的通用性和高性能。源代码可在\url{https://github.com/Windaway/DCAM}获取。

关键词

引用

@article{arxiv.2402.18109,
  title  = {Dual-Context Aggregation for Universal Image Matting},
  author = {Qinglin Liu and Xiaoqian Lv and Wei Yu and Changyong Guo and Shengping Zhang},
  journal= {arXiv preprint arXiv:2402.18109},
  year   = {2024}
}