中文

基于视觉情境比较的工业异常检测视觉-语言助手 AD-Copilot

计算机视觉与模式识别 2026-04-22 v2 人工智能

摘要

多模态大语言模型(MLLM)在自然视觉理解方面取得了显著的成功,但在工业异常检测(IAD)任务中始终表现不佳。这主要是因为大多数训练基于常规网络数据的 MLLM 与工业图像存在显著差异。此外,这些模型会独立编码每张图像,只能在语言空间中进行图像比较,因而对那些是 IAD 关键的细微视觉差异不够敏感。为解决这些问题,我们提出了 AD-Copilot,这是一种专为 IAD 设计的、通过视觉情境比较实现的交互式 MLLM。我们首先设计了一种新颖的数据 curated 流程,从稀疏标记的工业图像中挖掘检查知识,并生成用于描述、问答和缺陷定位的精确样本,构建了一个充满语义信号的大规模多模态数据集 Chat-AD。在此基础上,AD-Copilot 引入了 novel Comparison Encoder,通过成对图像特征之间的跨注意力机制来增强多图像的细粒度感知,并采用多阶段训练策略融入领域知识并逐步提升 IAD 技能。此外,我们引入了 MMAD-BBox,用于基于边界框评估的异常局部化扩展基准。实验表明,AD-Copilot 在 MMAD 测试基准上 achieves 82.3% 的准确率,超越所有其他模型且未发生数据泄漏。在 MMAD-BBox 测试中,性能相较于基线实现了最高提升的 3.35×3.35\times。AD-Copilot 还在其他专业和通用基准上展现出优异的性能泛化性。值得注意的是,AD-Copilot 在几项 IAD 任务中超越了人类专家水平,展示了其作为现实工业检查可靠助手的潜力。所有数据集和模型将为社区提供更广泛的益处。

关键词

引用

@article{arxiv.2603.13779,
  title  = {AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison},
  author = {Xi Jiang and Yue Guo and Jian Li and Yong Liu and Bin-Bin Gao and Hanqiu Deng and Jun Liu and Heng Zhao and Chengjie Wang and Feng Zheng},
  journal= {arXiv preprint arXiv:2603.13779},
  year   = {2026}
}

备注

Code and models are released at https://github.com/jam-cc/AD-Copilot