基于真实场景先验的野外自然图像抠图
计算机视觉与模式识别
2024-10-10 v1
摘要
最近的研究尝试将强大的交互式分割模型(如 SAM)适用于交互式抠图,并基于合成抠图数据集进行微调。然而,基于合成数据训练的模型难以泛化到复杂遮挡场景。我们提出了基于 COCO 数据集构建的新型抠图数据集,即 COCO-Matting。具体而言,COCO-Matting 的构建包括配件融合和掩码转抠图,该过程从 COCO 中选取真实复杂图像,将语义分割掩码转换为抠图标签。构建的 COCO-Matting 包含 38,251 个人类实例级 alpha 抠图,涵盖复杂自然场景。此外,现有基于 SAM 的抠图方法从冻结的 SAM中提取中间特征和掩码,仅通过端到端抠图损失训练轻量级抠图解码器,未充分发挥预训练 SAM 的潜力。因此,我们提出了 SEMat,对网络架构和训练目标进行了改造。网络架构方面,提出的特征对齐变换器学习提取细粒度边缘和透明度特征。提出的抠图对齐解码器旨在分割抠图特定对象,将粗糙掩码转换为高精度抠图。对于训练目标,提出的正则化损失和修正框损失旨在保留预训练模型的先验知识,并将从掩码解码器中提取的抠图 logits 推进至包含修正框语义信息。广泛的七个数据集实验表明,我们的方法在交互式自然图像抠图方面表现优异,证明了其有效性。我们开源代码、模型和数据集,地址为 https://github.com/XiaRho/SEMat。
引用
@article{arxiv.2410.06593,
title = {Towards Natural Image Matting in the Wild via Real-Scenario Prior},
author = {Ruihao Xia and Yu Liang and Peng-Tao Jiang and Hao Zhang and Qianru Sun and Yang Tang and Bo Li and Pan Zhou},
journal= {arXiv preprint arXiv:2410.06593},
year = {2024}
}