中文

操纵标签空间以提升上下文分类性能

计算机视觉与模式识别 2023-12-08 v2

摘要

在以先前词为条件生成下一个词进行预训练后,语言模型(LM)获得了上下文学习(ICL)的能力,即能根据给定的上下文示例(ICE)的上下文学习新任务。类似地,视觉条件语言建模也被用于训练具有 ICL 能力的视觉-语言模型(VLM)。然而,此类 VLM 的分类能力通常弱于基于对比学习的模型(如 CLIP),因为语言建模目标并不直接对比某一对象是否与文本配对。为改进分类的 ICL,使用更多 ICE 以提供更多知识是一种直接的方法。但这可能大幅增加选择时间,且更重要的是,额外上下文图像的引入往往使上下文序列长度超出 VLM 的处理能力。为缓解这些限制,我们提出操纵每个 ICE 的标签空间以提升其知识密度,从而用更少的 ICE 传达与更大集合相当的信息。具体而言,我们提出标签分布增强与视觉描述增强两种策略,以改进在包括经典 ImageNet 及更细粒度数据集(如 CUB-200)在内的多样数据集上的上下文分类性能。具体地,在 ImageNet 上采用我们的方法,我们在 2-shot 设定下将准确率从 4-shot 设定下的 74.70% 提升至 76.21%,超越 CLIP 0.67%。在 CUB-200 上,我们的方法将 1-shot 准确率从 48.86% 提升至 69.05%,比 CLIP 高 12.15%。代码见 https://anonymous.4open.science/r/MLS_ICC。

关键词

引用

@article{arxiv.2312.00351,
  title  = {Manipulating the Label Space for In-Context Classification},
  author = {Haokun Chen and Xu Yang and Yuhang Huang and Zihan Wu and Jing Wang and Xin Geng},
  journal= {arXiv preprint arXiv:2312.00351},
  year   = {2023}
}