物尽其用:低数据场景下预训练视觉语言模型的适配
计算机视觉与模式识别
2023-05-04 v1
摘要
大规模视觉语言模型被广泛用作预训练模型,并随后适配于各种下游任务。尽管已知人类能从少量示例中高效学习新任务,深度学习模型却难以从少量示例中进行适配。在本工作中,我们研究低数据场景下的任务适配,并对现有生成式视觉语言模型的适配方法进行了深入研究。我们展示了自标注的重要优势,即在可获取大量同分布未标注图像时,利用模型自身的预测进行自我改进。我们的研究证明,所提出的任务适配流程在广泛的视觉语言任务上取得了显著增益,例如视觉分类(ImageNet)、视觉描述(COCO)、细粒度视觉描述(Localised Narratives)以及视觉问答(VQAv2)。
引用
@article{arxiv.2305.02297,
title = {Making the Most of What You Have: Adapting Pre-trained Visual Language Models in the Low-data Regime},
author = {Chuhan Zhang and Antoine Miech and Jiajun Shen and Jean-Baptiste Alayrac and Pauline Luc},
journal= {arXiv preprint arXiv:2305.02297},
year = {2023}
}
备注
Tech Report