PromptMoE:通过视觉引导的提示混合实现通用零样异常检测
计算机视觉与模式识别
2025-11-25 v1
摘要
零样异常检测 (ZSAD) 旨在识别并局部化未见对象类的图像中的异常区域。虽然基于视觉语言模型如 CLIP 的近期方法显示出前景,但其性能受限于现有的提示工程策略。当前方法无论是依赖单一固定、可学习还是稠密动态提示,都存在表示瓶颈,容易在辅助数据上过拟合,无法泛化到未见异常的复杂性和多样性。为克服这些限制,我们提出 。我们的核心洞见是,稳健的 ZSAD 需要对提示学习进行组合方法。而不是学习单一的提示, 学习一组 expert 提示,作为可组合语义原语的基集合,以及一个视觉引导的混合专家 (MoE) 机制,动态组合它们以针对每个实例进行调制。我们的框架通过一种视觉引导的混合提示 (VGMoP) 实现了这一概念,采用图像门控稀疏 MoE 来聚合来自 diverse normal 和 abnormal expert state 提示,生成具有强大泛化能力的语义丰富文本表示。广泛的在 15 个数据集上的实验表明, 在有效性和业界领先性能方面均取得了显著成果。
引用
@article{arxiv.2511.18116,
title = {PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixtures},
author = {Yuheng Shao and Lizhang Wang and Changhao Li and Peixian Chen and Qinyuan Liu},
journal= {arXiv preprint arXiv:2511.18116},
year = {2025}
}
备注
14 pages, 8 figures. Accepted to AAAI 2026