DiffuMatting:合成具有抠图级标注的任意物体
计算机视觉与模式识别
2024-08-22 v2 人工智能
摘要
由于获取高精度或抠图标注的困难性和耗时性,公开可用的高精度标签数量有限。为了应对这一挑战,我们提出了 DiffuMatting,它继承了扩散模型强大的 Everything 生成能力,并赋予了“抠任何事物”的能力。我们的 DiffuMatting 可以:1) 作为一个具有高精度标注的任意事物抠图工厂;2) 与社区 LoRA 或各种条件控制方法良好兼容,以实现社区友好的艺术设计和可控生成。具体而言,受绿幕抠图的启发,我们旨在教导扩散模型在固定的绿幕画布上绘画。为此,我们收集了一个大规模绿幕数据集(Green100K)作为 DiffuMatting 的训练数据集。其次,提出了绿幕背景控制损失以保持画板为纯绿色,从而区分前景和背景。为了确保合成物体具有更多的边缘细节,提出了过渡边界细节增强损失作为指导,以生成具有更复杂边缘结构的物体。为了同时生成物体及其抠图标注,我们构建了一个抠图头,在 VAE 解码器的潜空间中进行去绿幕操作。我们的 DiffuMatting 展示了几种潜在应用(例如,抠图数据生成器、社区友好的艺术设计和可控生成)。作为抠图数据生成器,DiffuMatting 合成了通用物体和人像抠图数据集,在通用物体抠图任务中将相对 MSE 误差降低了 15.4%,在人像抠图任务中降低了 11.4%。数据集已在我们的项目页面 \url{https://diffumatting.github.io} 发布。
引用
@article{arxiv.2403.06168,
title = {DiffuMatting: Synthesizing Arbitrary Objects with Matting-level Annotation},
author = {Xiaobin Hu and Xu Peng and Donghao Luo and Xiaozhong Ji and Jinlong Peng and Zhengkai Jiang and Jiangning Zhang and Taisong Jin and Chengjie Wang and Rongrong Ji},
journal= {arXiv preprint arXiv:2403.06168},
year = {2024}
}
备注
This paper was accepted by ECCV 2024, and the project page is accessible at: \url{https://diffumatting.github.io}