中文

LogicAD:基于 VLM 的文本特征提取实现可解释异常检测

计算机视觉与模式识别 2025-01-09 v2

摘要

逻辑图像理解涉及解释和推理图像视觉内容中关系和一致性。在诸如工业检验等应用中,逻辑异常检测对于维持高质量标准和最小化昂贵召回率至关重要。先前的异常检测(AD)研究依赖于先验知识设计算法,往往需要大量手动标注、显著的计算资源和大量数据进行训练。自回归、多模态视觉语言模型(AVLM)因其在各种领域的视觉推理能力而成为一个有前景的替代方案。尽管如此,这些模型在逻辑 AD 的应用仍未被探索。在本 work 中,我们调查了使用 AVLMs 进行逻辑 AD 的可能性,并证明了它们非常适合这一任务。将 AVLMs 与格式嵌入和逻辑推理器结合,我们在公开基准数据集 MVTec LOCO AD 上实现了 SOTA 性能,AUROC 为 86.0%,F1-max 为 83.7%,并提供异常的解释。显著优于现有 SOTA 方法。

关键词

引用

@article{arxiv.2501.01767,
  title  = {LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction},
  author = {Er Jin and Qihui Feng and Yongli Mou and Stefan Decker and Gerhard Lakemeyer and Oliver Simons and Johannes Stegmaier},
  journal= {arXiv preprint arXiv:2501.01767},
  year   = {2025}
}

备注

Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/