Mask Factory:面向二值图像分割的高质量合成数据生成
计算机视觉与模式识别
2024-12-30 v1
摘要
二值图像分割(Dichotomous Image Segmentation, DIS)任务需要高度精确的标注,传统数据集创建方法代价高、耗时且需要大量专业领域知识。虽然使用合成数据可以解决上述问题,但现有的生成模型和技术在场景偏差、噪声引起的错误以及训练样本的多样性有限方面存在挑战。为此,我们提出一种新方法,\textbf{\ourmodel{}},为生成多样且精确的数据集提供可扩展的解决方案,显著减少准备时间和成本。我们首先引入一种通用的掩码编辑方法,将刚性和非刚性编辑技术相结合,以生成高质量的合成掩码。具体而言,刚性编辑利用扩散模型的几何先验,在零样本条件下实现精确的视角变换;而非刚性编辑则采用对抗训练和自注意力机制,以实现复杂且拓扑一致的修改。随后,我们采用多条件控制生成方法,生成分辨率高且分割掩码准确的图像-掩码对。最后,我们在广泛使用的DIS5K数据集基准上进行实验,证明与现有方法相比,在质量和效率方面表现出色。代码已公开于\url{https://qian-hao-tian.github.io/MaskFactory/}。
引用
@article{arxiv.2412.19080,
title = {Mask Factory: Towards High-quality Synthetic Data Generation for Dichotomous Image Segmentation},
author = {Haotian Qian and YD Chen and Shengtao Lou and Fahad Shahbaz Khan and Xiaogang Jin and Deng-Ping Fan},
journal= {arXiv preprint arXiv:2412.19080},
year = {2024}
}