面向数据稀缺场景的关键图像与标注合成统一扩散模型
计算机视觉与模式识别
2025-11-05 v2
摘要
数据稀缺的情况(如医疗、工业和自动驾驶等场景)导致模型过拟合和数据不平衡,从而阻碍有效的检测和分割性能。现有研究利用生成模型合成更多训练样本以缓解数据稀缺问题,但这些合成样本重复或简单,无法提供针对下游模型弱点的"关键信息"。此外,这些方法通常需要为不同对象分别训练,导致计算效率低下。为此,我们提出了 Crucial-Diff,一个面向合成关键样本的领域无关框架。我们的方法集成了两个关键模块。场景无关特征提取器 (SAFE) 利用统一特征提取器捕获目标信息。弱点感知样本矿工 (WASM) 利用下游模型检测结果的反馈生成难以检测的样本,然后与 SAFE 模块的输出进行融合。整个 Crucial-Diff 框架生成多样化的高质量训练数据,在 MVTec 上实现像级 AP 为 83.63%,F1-MAX 为 78.12%。在肠道异位肠管数据集上,Crucial-Diff 实现 mIoU 为 81.64%,mDice 为 87.69%。代码已公开于 https://github.com/JJessicaYao/Crucial-diff。
引用
@article{arxiv.2507.09915,
title = {Crucial-Diff: A Unified Diffusion Model for Crucial Image and Annotation Synthesis in Data-scarce Scenarios},
author = {Siyue Yao and Mingjie Sun and Eng Gee Lim and Ran Yi and Baojiang Zhong and Moncef Gabbouj},
journal= {arXiv preprint arXiv:2507.09915},
year = {2025}
}
备注
Accepted by IEEE Transactions on Image Processing (TIP), 2025