Free-Mask: 分割扩散模型与图像编辑融合的新范式
计算机视觉与模式识别
2025-07-08 v4 人工智能
摘要
当前的语义分割模型通常需要大量人工标注数据,这一过程既耗时又资源密集。另一种方法是利用先进的文本到图像模型(如 Midjourney 和 Stable Diffusion),这是一种高效策略,可通过自动生成合成数据来替代人工标注。然而,先前的方法仅限于生成单实例图像,因为利用 Stable Diffusion 生成多实例图像已被证明是不稳定的。为解决这一限制并扩展合成数据集的规模和多样性,我们提出了一种名为 Free-Mask 的框架,该框架将分割扩散模型与先进的图像编辑能力相结合,允许通过文本到图像模型将多个对象集成到图像中。我们的方法促进了高度逼真数据集的创建,这些数据集能够紧密模拟开放世界环境,同时生成精确的分割掩码。该方法减少了人工标注的工作量,并确保了精确的掩码生成。实验结果表明,Free-Mask 生成的合成数据使分割模型在性能上超越了在真实数据上训练的模型,尤其是在零样本设置中。值得注意的是,Free-Mask 在 VOC 2012 基准测试的未见类别上取得了新的最先进结果。
引用
@article{arxiv.2411.01819,
title = {Free-Mask: A Novel Paradigm of Integration Between the Segmentation Diffusion Model and Image Editing},
author = {Bo Gao and Jianhui Wang and Xinyuan Song and Yangfan He and Fangxu Xing and Tianyu Shi},
journal= {arXiv preprint arXiv:2411.01819},
year = {2025}
}
备注
Accepted by ACM MM(2025)