将视觉原型与BERT嵌入对齐用于少样本学习
计算机视觉与模式识别
2021-05-24 v1
摘要
少样本学习(FSL)是从少量训练样本中学习识别先前未见图像类别的任务。这是一项具有挑战性的任务,因为可用样本可能不足以明确确定哪些视觉特征最能代表所考虑类别的特性。为缓解此问题,我们提出一种额外考虑图像类名称的方法。虽然类名称的使用在先前工作中已被探索,我们的方法在两个关键方面有所不同。首先,先前工作旨在直接从词嵌入预测视觉原型,而我们发现将视觉与原型文本分开处理可获得更好结果。其次,我们提出一种使用BERT语言模型学习类名称嵌入的简单策略,发现其大幅优于先前工作中使用的GloVe向量。此外,受跨语言词嵌入对齐模型的启发,我们提出一种处理这些向量高维性的策略。我们在miniImageNet、CUB和tieredImageNet上提供实验,表明我们的方法持续提升了基于度量的FSL的最优水平。
引用
@article{arxiv.2105.10195,
title = {Aligning Visual Prototypes with BERT Embeddings for Few-Shot Learning},
author = {Kun Yan and Zied Bouraoui and Ping Wang and Shoaib Jameel and Steven Schockaert},
journal= {arXiv preprint arXiv:2105.10195},
year = {2021}
}
备注
Accepted by ICMR2021