基于EfficientNet和CLIP的无训练开放词汇图像分割与识别框架
计算机视觉与模式识别
2025-10-28 v2
摘要
本文提出了一种新颖的无训练框架,用于开放词汇图像分割和对象识别(OVSR),该框架利用卷积神经网络EfficientNetB0进行无监督分割,并利用视觉语言模型CLIP进行开放词汇对象识别。该框架采用两阶段流程:无监督图像分割 followed by 基于视觉语言对齐的分段级识别。在第一阶段,提取自EfficientNetB0的像素级特征通过奇异值分解(SVD)分解获得潜在表示,然后通过层次聚类进行分割,以获得语义上有意义的区域。聚类数的自适应确定基于奇异值的分布。在第二阶段,分割后的区域被局部化并编码为图像嵌入,采用CLIP的Vision Transformer背板。文本嵌入使用CLIP的文本编码器从类别特定提示中预计算,包括用于支持开放集识别的通用“其他”提示。图像和文本嵌入被拼接并通过SVD投影到共享的潜在特征空间以增强跨模态对齐。通过计算投影后图像和文本嵌入之间的相似度softmax进行识别。该方法在标准基准测试中进行评估,包括COCO、ADE20K和PASCAL VOC,在Hungarian mIoU、精确率、召回率和F1-score等指标上实现了最先进的性能。这些结果表明了该框架的有效性、灵活性和普适性。
关键词
引用
@article{arxiv.2510.19333,
title = {A Training-Free Framework for Open-Vocabulary Image Segmentation and Recognition with EfficientNet and CLIP},
author = {Ying Dai and Wei Yu Chen},
journal= {arXiv preprint arXiv:2510.19333},
year = {2025}
}