中文

基于类别提示细化特征学习的长尾多标签图像分类

计算机视觉与模式识别 2024-08-16 v1

摘要

现实世界的数据始终呈现长尾分布,常常跨越多个类别。这种复杂性凸显了在需要进行长尾多标签图像分类(LTMLC)时的内容理解挑战,尤其是在数据分布不平衡和多目标识别面前更为困难。为此,我们提出了一种 novel and effective 的方法用于 LTMLC,称为类别提示细化特征学习(Category-Prompt Refined Feature Learning, CPRFL),它利用不同类别之间的语义关联,并为每个类别解耦类别特定的视觉表征。具体而言,CPRFL 从预训练 CLIP 的嵌入初始化类别提示,通过与视觉特征的交互来解耦类别特定的视觉表征,从而促进了头类和尾类之间的语义关联的建立。为缓解视觉-语义领域偏差,我们设计了渐进式双路径反向传播机制,以逐步将与上下文相关的视觉信息纳入提示中,以细化这些提示。同时,细化过程还在细化提示的指导下,促进了类别特定视觉表征的渐进式净化。此外,考虑到负-正样本的不平衡,我们采用 Asymmetric Loss 作为优化目标,以抑制所有类别中的负样本,从而可能增强头类到尾类的识别性能。我们在两个 LTMLC 数据集上验证了方法的有效性,大量实验表明我们的方法在基线方法上具有优势。代码已公开于 https://github.com/jiexuanyan/CPRFL。

关键词

引用

@article{arxiv.2408.08125,
  title  = {Category-Prompt Refined Feature Learning for Long-Tailed Multi-Label Image Classification},
  author = {Jiexuan Yan and Sheng Huang and Nankun Mu and Luwen Huangfu and Bo Liu},
  journal= {arXiv preprint arXiv:2408.08125},
  year   = {2024}
}

备注

Accepted by ACM MM 2024