JoDiffusion:用于语义分割提升的联合扩散图像与像素级标注
计算机视觉与模式识别
2025-12-16 v1
摘要
鉴于像素级标注固有的高成本和耗时特性,构成足够多样化的合成图像并配以真实像素级标注的数据集,近年来备受关注,旨在训练高性能语义分割模型。然而,现有方法要么在图像生成后预测伪标注,要么依据手动标注掩码生成图像,分别导致图像-标注语义不一致或存在可扩展性问题。为同时解决上述问题,本文提出一种新颖的语义分割数据生成扩散框架,称为JoDiffusion。首先,给定标准潜在扩散模型,JoDiffusion集成独立的标注变分自编码器(VAE)网络,将标注掩码映射到与图像共享的潜在空间中。随后,针对文本提示定制扩散模型,以捕获每张图像及其标注掩码的联合分布。通过上述方式,JoDiffusion能够仅依据文本提示同时生成配对图像和语义一致的标注掩码,从而展现出卓越的可扩展性。此外,开发了一种掩码优化策略,以减轻生成过程中产生的标注噪声。在Pascal VOC、COCO和ADE20K数据集上的实验表明,由JoDiffusion生成的标注数据集在语义分割任务上显著优于现有方法。
引用
@article{arxiv.2512.13014,
title = {JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion},
author = {Haoyu Wang and Lei Zhang and Wenrui Liu and Dengyang Jiang and Wei Wei and Chen Ding},
journal= {arXiv preprint arXiv:2512.13014},
year = {2025}
}
备注
Accepted at AAAI 2026