TMUAD:通过文本记忆库提升统一异常检测模型的逻辑能力
计算机视觉与模式识别
2025-09-01 v1 人工智能
摘要
异常检测旨在识别偏离正常模式的异常,由于可用正常数据的有限,具有挑战。与大多数依赖精心设计的图像特征提取器和记忆库来捕获对象之间逻辑关系的统一方法不同,我们引入文本记忆库以增强逻辑异常的检测。具体而言,我们提出了用于统一结构和逻辑异常检测的Three-Memory框架(TMUAD)。首先,我们通过提出的 logic-aware text extractor 构建了用于逻辑异常检测的 class-level 文本记忆库,能够从输入图像中捕获丰富的对象逻辑描述。其次,我们构建了 object-level 图像记忆库,通过从分段对象中提取特征来保留完整的对象轮廓。最后,我们使用视觉编码器提取 patch-level 图像特征,用于构建用于结构异常检测的 patch-level 记忆库。这三个互补的记忆库用于检索与查询图像最相似的正常图像,在多个层次上计算异常得分,并融合为最终异常得分。通过协同记忆库实现结构和逻辑异常检测的统一,TMUAD 在涉及工业和医疗领域的七个公开数据集上实现了最先进的性能。该模型和代码均已公开于 https://github.com/SIA-IDE/TMUAD。
引用
@article{arxiv.2508.21795,
title = {TMUAD: Enhancing Logical Capabilities in Unified Anomaly Detection Models with a Text Memory Bank},
author = {Jiawei Liu and Jiahe Hou and Wei Wang and Jinsong Du and Yang Cong and Huijie Fan},
journal= {arXiv preprint arXiv:2508.21795},
year = {2025}
}