中文

AG-VAS:基于大型多模态模型的锚定引导零样视觉异常分段

计算机视觉与模式识别 2026-03-31 v2 人工智能

摘要

大型多模态模型(LMM)表现出强大的任务泛化能力,为零样视觉异常分段(ZSAS)提供了新机会。然而,现有的基于LMM的分段方法仍面临根本性限制:异常概念本质上是抽象且情境依赖的,缺乏稳定的视觉原型;此外,高层次语义嵌入与像素级空间特征之间的弱对齐阻碍了精确的异常定位。为解决这些挑战,我们提出了AG-VAS(Anchor-Guided Visual Anomaly Segmentation),一个新的框架,通过引入三个可学习的语义锚定标记 [SEG]、[NOR] 和 [ANO] 来扩展LMM的词汇表,建立统一的锚定引导分段范式。具体而言,[SEG] 作为绝对语义锚定,将抽象的异常语义转化为明确的、以空间为依托的视觉实体(如孔洞或划痕),而 [NOR] 和 [ANO] 则作为相对锚定,建模正常与异常模式在不同类别之间的情境对比。为进一步增强跨模态对齐,我们引入语义-像素对齐模块(SPAM),对齐语言级语义嵌入与高分辨率视觉特征,并设计锚定引导掩码解码器(AGMD),执行锚定条件掩码预测以实现精确的异常定位。此外,我们 curated 了一个大规模指令数据集 Anomaly-Instruct20K,将异常知识组织为外观、形状和空间属性的结构化描述,促进了有效的学习和语义锚定的集成。在六个工业和医疗基准测试上进行的广泛实验表明,AG-VAS 在零样设置下实现了一致的领先性能。

关键词

引用

@article{arxiv.2603.01305,
  title  = {AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models},
  author = {Zhen Qu and Xian Tao and Xiaoyi Bao and Dingrong Wang and ShiChen Qu and Zhengtao Zhang and Xingang Wang},
  journal= {arXiv preprint arXiv:2603.01305},
  year   = {2026}
}