无提示条件扩散用于多目标图像增强
计算机视觉与模式识别
2025-07-09 v1
摘要
扩散模型在计算机视觉任务中支撑了大量近期进展。然而,在涉及生成真实场景中的多目标图像时,现有大多数方法要么完全依赖文本条件,导致生成对象与原始数据之间偏差,要么过度依赖原始图像,导致生成图像的多样性不足,对下游任务帮助有限。为同时解决这两个问题,我们提出了一种用于多目标图像增强的无提示条件扩散框架。具体而言,我们引入局部-全局语义融合策略,从图像中提取语义信息以取代文本,通过 LoRA 将知识注入扩散模型,以缓解原始模型与目标数据集之间的类别偏差。此外,我们设计了基于计数损失的奖励模型,以辅助传统的重建损失进行模型训练。通过约束每个类别的对象数量,而非像素级约束,既桥接了生成数据与原始数据之间的数量偏差,又提高了生成数据的多样性。实验结果表明,所提方法在多个代表性最新方法上均表现出优势,并展示了强大的下游任务收益和跨域泛化能力。代码可在 \href{https://github.com/00why00/PFCD}{这里}获取。
引用
@article{arxiv.2507.06146,
title = {Prompt-Free Conditional Diffusion for Multi-object Image Augmentation},
author = {Haoyu Wang and Lei Zhang and Wei Wei and Chen Ding and Yanning Zhang},
journal= {arXiv preprint arXiv:2507.06146},
year = {2025}
}
备注
Accepted at IJCAI 2025