FILM:少样本图像分类如何受益于预训练语言模型?
机器学习
2023-07-11 v1 人工智能
计算与语言
计算机视觉与模式识别
多媒体
摘要
少样本学习旨在训练能够仅用少量样本泛化到新类别的模型。最近,一系列工作被提出以利用来自类名的可用语义信息增强少样本学习。然而,这些工作侧重于改进标准少样本学习框架的现有模块,如视觉原型和特征提取器。这限制了语义信息的充分利用。在本文中,我们提出了一种新颖的少样本学习框架,该框架使用基于对比学习的预训练语言模型。为解决从基于文本的预训练语言模型获得的视觉特征与文本嵌入之间对齐的挑战,我们精心设计了框架的文本分支,并引入度量模块以推广余弦相似度。为获得更好的可迁移性,我们让度量模块适应不同的少样本任务,并采用MAML通过双层优化训练模型。此外,我们在多个基准上进行了大量实验以证明我们方法的有效性。
引用
@article{arxiv.2307.04114,
title = {FILM: How can Few-Shot Image Classification Benefit from Pre-Trained Language Models?},
author = {Zihao Jiang and Yunkai Dang and Dong Pang and Huishuai Zhang and Weiran Huang},
journal= {arXiv preprint arXiv:2307.04114},
year = {2023}
}