面向少样本异常检测的视觉-文本多模态融合网络VTFusion
计算机视觉与模式识别
2026-01-26 v1
摘要
少样本异常检测(FSAD)是识别稀缺正常参考中异常现象的关键范式。虽然近期方法整合文本语义来补充视觉数据,但主要依赖自然场景预训练特征,忽略了工业检测中必需的细粒度、领域特定语义。此外,常见的融合策略常采用浅层拼接,无法解决视觉与文本模态间固有的语义错位问题,削弱了对跨模态干扰的鲁棒性。为弥合这些差距,本文提出VTFusion,一个专为FSAD设计的视觉-文本多模态融合框架。该框架包含两个核心设计:首先,引入针对图像和文本模态的自适应特征提取器,学习任务特定的表征,弥合预训练模型与工业数据的差距;同时,通过生成多样化的合成异常,增强特征的判别性。其次,开发专门的多模态预测融合模块,包含促进丰富跨模态信息交换的融合块,以及在多模态引导下生成细化像素级异常图的分割网络。VTFusion显著提升了FSAD性能,在MVTec AD和VisA数据集的2-shot场景下,分别实现了96.8%和86.2%的图像级AUROC,并在本文引入的真实世界汽车塑料件数据集上实现了93.5%的AUPRO,进一步证明了其在严苛工业场景中的实际应用价值。
引用
@article{arxiv.2601.16381,
title = {VTFusion: A Vision-Text Multimodal Fusion Network for Few-Shot Anomaly Detection},
author = {Yuxin Jiang and Yunkang Cao and Yuqi Cheng and Yiheng Zhang and Weiming Shen},
journal= {arXiv preprint arXiv:2601.16381},
year = {2026}
}