大规模通用缺陷生成:基础模型与数据集
计算机视觉与模式识别
2026-04-13 v1 人工智能
摘要
现有的缺陷/异常生成方法常依赖少量样本学习,由于缺乏大规模的配对缺陷编辑数据,导致对特定缺陷类别过拟合。这种问题因缺陷规模和形貌的显著差异而加剧,导致泛化性差、真实性下降和类别一致性受损。我们通过引入UDG(30万 normal-abnormal-mask-caption 四元组的数据集,涵盖多个领域),并提出UniDG(通用缺陷生成基础模型),实现无需按类别微调即可支持基于参考的缺陷生成和基于文本指令的缺陷编辑。UniDG通过自适应缺陷裁剪和结构化双栏输入格式进行缺陷-上下文编辑,通过MM-DiT 多模态注意力融合参考条件与目标条件。采用 Diversity-SFT 随后 Consistency-RFT 两阶段训练策略,进一步提升多样性,同时增强真实性和参考一致性。在MVTec-AD 和 VisA 上进行的大量实验表明,UniDG 在合成质量和下游单类及多类异常检测/定位方面超越了以往的少量样本异常生成和图像插入/编辑基线方法。代码将在 https://github.com/RetoFan233/UniDG 上发布。
引用
@article{arxiv.2604.08915,
title = {Large-Scale Universal Defect Generation: Foundation Models and Datasets},
author = {Yuanting Fan and Jun Liu and Bin-Bin Gao and Xiaochen Chen and Yuhuan Lin and Zhewei Dai and Jiawei Zhan and Chengjie Wang},
journal= {arXiv preprint arXiv:2604.08915},
year = {2026}
}
备注
25 pages, 13 figures, preprint