从CLIP中挖掘开放语义:面向小样本学习的关系转换视角
计算机视觉与模式识别
2024-07-01 v2
摘要
对比视觉语言预训练(CLIP)展现了令人印象深刻的零样本能力。利用少量样本提升CLIP适应下游任务的关键在于如何有效建模和迁移CLIP中嵌入的有用知识。先前的工作通常基于有限的视觉样本和封闭语义(即下游任务的目标类别集内)来挖掘知识。然而,对齐的CLIP图像/文本编码器包含了视觉特征与几乎无限开放语义之间的丰富关系,这可能有利于小样本学习,但尚未被探索。在本文中,我们提出挖掘开放语义作为锚点,执行从图像-锚点关系到图像-目标关系的关系转换以进行预测。具体来说,我们采用一个Transformer模块,将视觉特征作为“Query”,锚点的文本特征作为“Key”,锚点与目标类别的文本特征之间的相似度矩阵作为“Value”。通过这种方式,该Transformer模块的输出代表了图像与目标类别之间的关系,即分类预测。为了避免手动选择开放语义,我们使输入文本嵌入中的[CLASS] token可学习。我们在十一个代表性分类数据集上进行了广泛实验。结果表明,在小样本分类设置下,我们的方法性能优于先前的最先进方法。
引用
@article{arxiv.2406.11252,
title = {Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning},
author = {Cilin Yan and Haochen Wang and Xiaolong Jiang and Yao Hu and Xu Tang and Guoliang Kang and Efstratios Gavves},
journal= {arXiv preprint arXiv:2406.11252},
year = {2024}
}