Align3D-AD:用于零样本3D异常检测的跨模态特征对齐与双提示学习
计算机视觉与模式识别
2026-05-08 v1
摘要
零样本3D异常检测旨在识别不访问目标类别训练数据的异常。然而,现有方法主要依赖将3D观测投影到多视角表示上,这些表示主要捕获几何线索而非真实视觉语义,并与预训练于RGB数据的视觉编码器处理,导致编码器与投影表示之间存在显著的域间差距。为此,我们提出Align3D-AD,一个统一的两阶段框架,利用来自辅助类别的RGB模态作为跨模态指导实现零样本3D异常检测。首先,我们引入一种跨模态特征对齐范式,将渲染特征映射到RGB语义空间。不同于先前方法依赖隐式预训练编码器,本方法实现从RGB观测中进行直接语义传递。进一步引入语义一致性重加权策略,根据整体语义一致性对局部区域进行重加权,以细化特征对齐。其次,我们提出一种模态感知提示学习框架,采用双提示对比对齐。通过为RGB对齐特征和渲染特征分配独立提示,本方法捕获跨模态的互补语义,而对比对齐进一步增强提示表示以提高辨识度。大量实验表明,在一个与零样本方法的显著优势下,Align3D-AD在MVTec3D-AD、Eyecandies和Real3D-AD上实现了一致的优越性,凸显了其泛化能力和鲁棒性。代码和数据集将在论文接受后公开。
引用
@article{arxiv.2605.05850,
title = {Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection},
author = {Letian Bai and Xuanming Cao and Juan Du and Chengyu Tao},
journal= {arXiv preprint arXiv:2605.05850},
year = {2026}
}