中文

基于小型视觉语言模型的自监督开放式分类

计算机视觉与模式识别 2023-12-07 v2

摘要

我们提出自上下文适配(SeCAt),一种自监督方法,可释放小型视觉语言模型用于开放式分类的小样本能力。我们的方法以自监督方式模仿图像描述,基于对大量图像池进行聚类,然后为聚类分配语义无关的名称。通过这样做,我们构建了一个由交错的图像与伪描述对序列及查询图像组成的训练信号,我们称之为“自上下文”序列。基于该信号,模型被训练以产生正确的伪描述。我们在多个涵盖不同粒度的多模态小样本数据集上展示了 SeCAt 的性能和灵活性。通过使用约 10 亿参数的模型,我们超越了更大模型(如 Frozen 和 FROMAGe)的小样本能力。SeCAt 为开放式小样本学习的研究和应用开辟了新可能,否则这些需要访问大型或专有模型。

关键词

引用

@article{arxiv.2310.00500,
  title  = {Self-Supervised Open-Ended Classification with Small Visual Language Models},
  author = {Mohammad Mahdi Derakhshani and Ivona Najdenkoska and Cees G. M. Snoek and Marcel Worring and Yuki M. Asano},
  journal= {arXiv preprint arXiv:2310.00500},
  year   = {2023}
}