中文

面向多标签视觉提示调优的关联性与判别性标签分组

计算机视觉与模式识别 2025-07-10 v2

摘要

建模标签之间的相关性始终是多标签图像分类(MLC)中关键性因素,吸引了研究者的广泛关注。然而,最近的研究过于强调标签之间的共现关系,这可能导致对这种强调的过拟合风险,进而导致模型性能 suboptimal。为解决此问题,我们主张在标签之间的相关性和判别性关系之间进行平衡,以缓解过拟合风险并提升模型性能。为此,我们提出了 Multi-Label Visual Prompt Tuning 框架,这是一种新颖且参数高效的方法,按照标签的共现关系和互斥关系将类别分组到多个子集中,然后分别对这些子集进行建模,以实现两种关系的平衡。在本工作中,由于每个分组包含多个类别,采用多个提示标记于 Vision Transformer(ViT)中,以捕获每个分组内部的相关性或判别性标签关系,并有效学习类别子集的相关性或判别性表示。另一方面,每个分组包含多个可能对应多个类别的分组感知视觉表示,混合专家(MoE)模型可以巧妙地将这些分组感知表示分配到标签感知表示,从而自适应获得更有利于分类的标签感知表示。在多个基准数据集上的实验表明,我们提出的方法在获得竞争性结果方面具有优势,并在多个预训练模型上超越了 SOTA 方法。

关键词

引用

@article{arxiv.2504.09990,
  title  = {Correlative and Discriminative Label Grouping for Multi-Label Visual Prompt Tuning},
  author = {LeiLei Ma and Shuo Xu and MingKun Xie and Lei Wang and Dengdi Sun and Haifeng Zhao},
  journal= {arXiv preprint arXiv:2504.09990},
  year   = {2025}
}

备注

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025