中文

NexViTAD:基于视觉基础模型和多任务学习的 few-shot 无监督跨域缺陷检测

计算机视觉与模式识别 2025-07-11 v1 人工智能

摘要

本文提出了一种新型 few-shot 跨域异常检测框架——Nexus Vision Transformer for Anomaly Detection(NexViTAD),基于视觉基础模型,有效解决了工业异常检测中的 domain-shift 挑战。我们的框架通过创新的共享子空间投影机制和多任务学习(MTL)模块实现。主要创新点包括:(1)层次化适配器模块可适应性地融合 Hiera 和 DINO-v2 预训练模型的互补特征,构建更稳健的特征表征;(2)共享子空间投影策略通过瓶颈维度约束和跳跃连接机制实现有效的跨域知识迁移;(3)MTL 解码器架构支持多源域的同步处理,显著提升模型的泛化能力;(4)基于 Sinkhorn-K-means 聚类的异常得分推理方法,结合高斯滤波和自适应阈值处理,实现像素级精确检测。在 MVTec AD 数据集上,NexViTAD 实现了最先进的性能,目标域的 AUC 为 97.5%,AP 为 70.4%,PRO 为 95.2%,超越了其他近期模型,标志着跨域缺陷检测的变革性进展。

关键词

引用

@article{arxiv.2507.07579,
  title  = {NexViTAD: Few-shot Unsupervised Cross-Domain Defect Detection via Vision Foundation Models and Multi-Task Learning},
  author = {Tianwei Mu and Feiyu Duan and Bo Zhou and Dan Xue and Manhong Huang},
  journal= {arXiv preprint arXiv:2507.07579},
  year   = {2025}
}