Matte Anything:基于 Segment Anything 模型的交互式自然图像抠图
计算机视觉与模式识别
2024-02-29 v2
摘要
自然图像抠图算法旨在利用 trimap 引导预测透明度图(alpha-matte)。然而,trimap 的制作常需大量人工,限制了抠图算法的大规模广泛应用。为解决该问题,我们提出 Matte Anything (MatAny),一种可通过各种简单提示产生高质量 alpha-matte 的交互式自然图像抠图模型。MatAny 的核心思路是通过轮廓与透明度预测自动生成伪 trimap。在我们的工作中,我们利用视觉基础模型增强自然图像抠图性能。具体而言,我们使用 segment anything 模型通过用户交互预测高质量轮廓,并使用开放词汇检测器预测任意对象的透明度。随后,预训练图像抠图模型利用伪 trimap 生成 alpha matte。MatAny 是迄今支持交互方式最多且性能最佳的交互式抠图算法。它由正交视觉模型构成,无需任何额外训练。我们将 MatAny 与几种当前图像抠图算法的性能进行了评估。相比先前具简单引导的图像抠图方法,MatAny 在 MSE 上提升 58.3%,在 SAD 上提升 40.6%,达到了新的当前最优(SOTA)性能。源代码与预训练模型可在 https://github.com/hustvl/Matte-Anything 获取。
引用
@article{arxiv.2306.04121,
title = {Matte Anything: Interactive Natural Image Matting with Segment Anything Models},
author = {Jingfeng Yao and Xinggang Wang and Lang Ye and Wenyu Liu},
journal= {arXiv preprint arXiv:2306.04121},
year = {2024}
}
备注
21 pages, codes: https://github.com/hustvl/Matte-Anything