中文

M-Tuning:开放集场景下缓解标签偏置的提示微调方法

计算机视觉与模式识别 2024-12-31 v3

摘要

在现实开放集场景中,部分测试数据的标签完全未知,当视觉-语言(VL)提示学习方法遇到与未知类相关的输入(即训练时未见过)时,它们总是将其预测为某个训练类之一。所表现出的标签偏置给开放集识别(OSR)带来困难,在OSR中图像应被正确预测为已知类之一或未知类。为实现此目标,我们提出了一种缓解标签偏置的视觉-语言提示微调方法(M-Tuning)。它从WordNet引入开放词,将构成提示文本的词汇范围从仅闭集标签词扩展至更多词,从而在模拟开放集场景下对提示进行微调。此外,受“在大型数据集上直接分类比在小型数据集上导致高得多的假正率”这一观察的启发,我们提出组合微调与测试(CTT)策略以提升性能。CTT将大型数据集上的M-Tuning分解为针对更少类的多个独立分组微调,随后通过选择最优子提示做出准确而全面的预测。最后,鉴于文献中缺乏基于VL的OSR基线(尤其是提示方法),我们提供了用于公平比较的新基线。我们的方法在多种规模的数据集上取得最佳性能,大量消融实验也验证了其有效性。

关键词

引用

@article{arxiv.2303.05122,
  title  = {M-Tuning: Prompt Tuning with Mitigated Label Bias in Open-Set Scenarios},
  author = {Ning Liao and Xiaopeng Zhang and Min Cao and Junchi Yan},
  journal= {arXiv preprint arXiv:2303.05122},
  year   = {2024}
}

备注

Accepted by IEEE TCSVT