中文

IAD-Unify:用于工业异常分割、理解和生成的区域 grounding 统一模型

计算机视觉与模式识别 2026-04-15 v1 人工智能

摘要

实际的工业检查不仅需要局部定位缺陷,还需要以自然语言解释缺陷并生成受控的缺陷编辑。然而,现有方法未能在统一框架和评估协议中支持这三项能力。我们提出 IAD-Unify,一种双编码器统一框架,其中基于冻结 DINOv2 的区域专家通过轻量级 token 注入向共享的 Qwen3.5-4B 视觉语言主干提供精确的异常证据,从而在统一方式下实现异常分割、区域 grounding 理解和掩码引导生成。为实现统一评估,我们进一步构建了 Anomaly-56K,一个涵盖 59,916 张图像、24 个类别和 104 种缺陷变体的综合统一多任务 IAD 评估平台。受控消融实验得出四项发现:(i) 区域 grounding 是理解的决定性机制,移除后位置准确性下降 >76pp;(ii) 预测区域性能与 oracle 接近,确认了部署可行性;(iii) 区域 grounding 生成在整体图像保真度和掩码区域感知质量方面取得最佳;(iv) 预初始化的联合训练在几乎不增加生成成本(-0.16 dB)的情况下提升了理解能力。IAD-Unify 还在 MMAD 数据集上实现了强大的性能,包括训练期间未出现的类别,表明其具有强大的跨类别泛化能力。

关键词

引用

@article{arxiv.2604.12440,
  title  = {IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation},
  author = {Haoyu Zheng and Tianwei Lin and Wei Wang and Zhuonan Wang and Wenqiao Zhang and Jiaqi Zhu and Feifei Shao},
  journal= {arXiv preprint arXiv:2604.12440},
  year   = {2026}
}