中文

AnomalyXFusion:基于扩散的多模态异常合成

计算机视觉与模式识别 2024-05-03 v2

摘要

异常合成是增强异常样本训练数据集的有效方法之一。然而,当前的异常合成方法主要依赖纹理信息作为输入,限制了合成异常样本的保真度。由于纹理信息不足以正确描绘异常的模式,尤其是对于逻辑异常,情况更为如此。为克服这一障碍,我们提出了AnomalyXFusion框架,旨在利用多模态信息来提升合成异常样本的质量。AnomalyXFusion框架包含两个distinct yet synergistic的模块:多模态In-Fusion (MIF)模块和动态Dif-Fusion (DDF)模块。MIF模块通过聚合和整合各种模态特征到统一的嵌入空间(称为X-嵌入),包括图像、文本和掩码特征,从而细化模态对齐。同时,DDF模块通过根据扩散步骤对X-嵌入进行自适应调整,实现受控生成。此外,为揭示AnomalyXFusion的多模态表征能力,我们提出了新数据集,称为MVTec Caption。更准确地说,MVTec Caption为MVTec AD和LOCOD数据集提供了2.2k条准确的图像-掩码-文本注释。全面的评估表明,AnomalyXFusion特别在逻辑异常的保真度和多样性方面效果显著。项目页面:http:github.com/hujiecpp/MVTec-Caption

关键词

引用

@article{arxiv.2404.19444,
  title  = {AnomalyXFusion: Multi-modal Anomaly Synthesis with Diffusion},
  author = {Jie Hu and Yawen Huang and Yilin Lu and Guoyang Xie and Guannan Jiang and Yefeng Zheng and Zhichao Lu},
  journal= {arXiv preprint arXiv:2404.19444},
  year   = {2024}
}