中文

抠图任意物

计算机视觉与模式识别 2023-11-20 v2

摘要

本文提出抠图任意物模型(MAM),一种高效且通用的框架,可在灵活交互的视觉或语言用户提示引导下,估计图像中任意实例的alpha抠图。相较于以往专用的图像抠图网络,MAM具有若干显著优势:(i) MAM仅用单一模型即可处理各类图像抠图,包括语义、实例与指代图像抠图;(ii) MAM利用Segment Anything Model (SAM)的特征图,并采用轻量级Mask-to-Matte (M2M)模块通过迭代精炼预测alpha抠图,其可训练参数仅270万。(iii) 通过结合SAM,MAM将图像抠图交互使用所需的用户干预由trimap简化为框、点或文本提示。我们在多种图像抠图基准上评估MAM性能,实验结果表明,在各基准的不同指标下,MAM取得了与最先进专用图像抠图模型相当的性能。总体而言,MAM展现出优越的泛化能力,能以更少参数有效处理各类图像抠图任务,是统一图像抠图的实用方案。我们的代码与模型已开源:https://github.com/SHI-Labs/Matting-Anything。

关键词

引用

@article{arxiv.2306.05399,
  title  = {Matting Anything},
  author = {Jiachen Li and Jitesh Jain and Humphrey Shi},
  journal= {arXiv preprint arXiv:2306.05399},
  year   = {2023}
}

备注

Project web-page: https://chrisjuniorli.github.io/project/Matting-Anything/