[CLS]并不够:基于 patch 级推断与自适应聚合的多标签识别
计算机视觉与模式识别
2026-05-26 v1
摘要
视觉语言模型如CLIP通过将图像与文本概念对齐显示出强大的零样本识别能力,但在多标签识别方面往往表现不佳,其中多个对象共存。关键瓶颈是[CLS]标记作为单一全局视觉表征,难以忠实地编码具有不同尺度、上下文和共现模式的多样化目标。为解决此限制,我们提出一种新的多标签图像识别框架,称为PIAA,其将预测形式化为patch 级推断后跟自适应聚合。具体而言,我们首先从两个互补角度增强 patch 级预测:(i)缓解视觉编码器中的语义交织,以获得更具辨识力的 patch 表示;(ii)学习无监督视觉分类器以缩小视觉-语言模态间隙。随后,我们引入自适应聚合模块,将 patch 级得分整合为最终的多标签预测。值得注意的是,整个管道完全无训练要求,不需要梯度更新或参数微调。实验表明,我们的方法在计算开销最小增益的情况下实现了显著提升,在具有挑战性的NUS-WIDE基准上相对于代表性基线实现了超过6%的mAP提升。代码可在https://github.com/akang-wang/PIAA获取。
引用
@article{arxiv.2605.25821,
title = {[CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation},
author = {Akang Wang and Xili Deng and Zhanxuan Hu and Yi Zhao and Yonghang Tai and Huafeng Li},
journal= {arXiv preprint arXiv:2605.25821},
year = {2026}
}