结合 VLM-LLM 特征的渐进式对齐以增强 ASE 数据集的缺陷分类
计算机视觉与模式识别
2024-04-09 v1 机器学习
摘要
传统的缺陷分类方法面临两大障碍。(1)训练数据不足和数据质量不稳定。收集足够的缺陷样本既昂贵又耗时,从而导致数据集方差。这给识别和学习带来了困难。(2)过度依赖视觉模态。当给定数据集中所有缺陷类别的图像模式和纹理单调时,传统 AOI 系统的性能无法得到保证。在由于机械故障导致图像质量受损或缺陷信息本身难以辨别的情况下,深度模型的性能也无法得到保证。一个主要问题是:“当这两个问题同时发生时,如何解决它们?”可行的策略是探索数据集中的另一种特征,并结合具有惊人零样本能力的优秀视觉语言模型(VLM)和大语言模型(LLM)。在这项工作中,我们提出了特殊的 ASE 数据集,包含记录在图像上的丰富数据描述用于缺陷分类,但缺陷特征不易直接学习。其次,我们针对缺陷分类提出了结合所提出的 ASE 数据集的 VLM-LLM 提示,以从图像中激活跨模态特征从而增强性能。然后,我们设计了新颖的渐进式特征对齐(PFA)块来精炼图像-文本特征,以缓解少样本场景下对齐的困难。最后,所提出的跨模态注意力融合(CMAF)模块能够有效融合不同模态的特征。实验结果证明了我们的方法在 ASE 数据集上优于多种缺陷分类方法。
引用
@article{arxiv.2404.05183,
title = {Progressive Alignment with VLM-LLM Feature to Augment Defect Classification for the ASE Dataset},
author = {Chih-Chung Hsu and Chia-Ming Lee and Chun-Hung Sun and Kuang-Ming Wu},
journal= {arXiv preprint arXiv:2404.05183},
year = {2024}
}
备注
MULA 2024