TIPS 超越技巧:用于有效零样本异常检测的简单提示
计算机视觉与模式识别
2026-02-26 v2
摘要
异常检测识别安全关键环境中偏离预期行为的 departures。当目标域正常数据不可用时,零样本异常检测(ZSAD)利用视觉语言模型(VLMs)。然而,CLIP 的粗糙图像-文本对齐限制了局部分辨和检测,原因有 (i) 空间错位和 (ii) 对细粒度异常的灵敏度不足; prior 方法通过复杂的辅助模块来补偿,却大体上忽略了 backbone 的选择。我们重新审视 backbone,采用 TIPS——该模型是通过空间感知目标训练的 VLM。虽然 TIPS 缓解了 CLIP 的问题,但它暴露了全局特征与局部特征之间的分布差距。我们通过固定图像级提示和可学习的像素级局部分辨提示来解决这一问题,并注入局部证据到全局得分中。不使用 CLIP 特定的技巧,我们的 TIPS 基于管道的方法在七个工业数据集上将图像级性能提升 1.1-3.9%,像素级性能提升 1.5-6.9%,同时保持强大的泛化能力和轻量级架构。代码已在 github.com/AlirezaSalehy/Tipsomaly 提供。
引用
@article{arxiv.2602.03594,
title = {TIPS Over Tricks: Simple Prompts for Effective Zero-shot Anomaly Detection},
author = {Alireza Salehi and Ehsan Karami and Sepehr Noey and Sahand Noey and Makoto Yamada and Reshad Hosseini and Mohammad Sabokrou},
journal= {arXiv preprint arXiv:2602.03594},
year = {2026}
}
备注
This is the extended version of the paper accepted in ICASSP'26, which will be publicly available in May. Authors' contributions may vary among the versions