释放视觉语言模型在长尾多标签视觉识别中的强大能力
计算机视觉与模式识别
2025-11-26 v1 机器学习
摘要
长尾多标签视觉识别面临重大挑战,因为图像通常包含多个标签且类别分布高度不平衡,导致模型偏向头类而在尾类上表现不佳。近期研究利用预训练的视觉语言模型(如CLIP)结合长尾学习技术,利用丰富的视觉-文本先验以提升性能。然而,现有方法常直接从不平衡数据集中派生语义类别间关系,由于数据稀缺,导致尾类的关联性不可靠。此外,CLIP的零样本范式针对单标签图像-文本匹配进行优化,对于多标签任务不够理想。为解决这些问题,我们提出了关联适应提示网络(CAPNET),一个新型端到端框架,显式地从CLIP的文本编码器中建模标签间的关联性。该框架集成图卷积网络进行标签感知的传播和可学习的软提示以获得精炼的嵌入。它利用分布平衡的Focal loss配合类别感知的再加权,以在不平衡情况下进行优化训练。此外,它通过测试时集成和参数高效微调来提升泛化能力,同时实施视觉-文本模态重新对齐,以避免在尾类上过拟合且不损害头类的性能。广泛的实验和消融研究在包括VOC-LT、COCO-LT和NUS-WIDE在内的基准上表明,CAPNET在状态方法上实现了显著的改进,验证了其在实际长尾多标签视觉识别中的有效性。
引用
@article{arxiv.2511.20641,
title = {Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition},
author = {Wei Tang and Zuo-Zheng Wang and Kun Zhang and Tong Wei and Min-Ling Zhang},
journal= {arXiv preprint arXiv:2511.20641},
year = {2025}
}