中文

VID-AD: 面向视觉诱导干扰下的图像级逻辑异常检测数据集

计算机视觉与模式识别 2026-03-17 v1

摘要

工业检查中的逻辑异常检测因视觉外观差异(如背景杂乱、光照变化和模糊)而具有挑战性,这些因素常常干扰以视觉为中心的检测器识别规则级违规。然而,现有基准数据集很少提供逻辑状态固定且此类干扰因素变化的受控环境。为此,我们引入 VID-AD,一个针对视觉诱导干扰下的逻辑异常检测数据集。它包含 10 个制造场景和 5 种捕获条件,总计 50 个单类任务和 10,395 张图像。每个场景由从数量、长度、类型、位置和关系中选取的两个逻辑约束定义,异常包括单约束违规和组合违规。我们进一步提出了一种基于语言的异常检测框架,该框架仅依赖于从正常图像生成的文本描述。通过使用正面文本和基于这些描述的矛盾负面文本进行对比学习,我们的方法学习到的嵌入能够捕捉逻辑属性而非低层特征。广泛的实验表明,在所评估的各种设置下,本方法均显著优于基线方法。数据集可在 https://github.com/nkthiroto/VID-AD 获取。

关键词

引用

@article{arxiv.2603.13964,
  title  = {VID-AD: A Dataset for Image-Level Logical Anomaly Detection under Vision-Induced Distraction},
  author = {Hiroto Nakata and Yawen Zou and Shunsuke Sakai and Shun Maeda and Chunzhi Gu and Yijin Wei and Shangce Gao and Chao Zhang},
  journal= {arXiv preprint arXiv:2603.13964},
  year   = {2026}
}