TAP:面向任务自适应生成视觉分类文本训练样本的定向提示方法
计算机视觉与模式识别
2023-09-14 v1
摘要
视觉与语言模型(VLMs,如 CLIP)已能够识别由文本提示描述的潜在无限类别。然而,为获得最佳视觉识别性能,这些模型仍需微调以更好地拟合下游任务的数据分布,从而克服基于网络预训练数据带来的域偏移。最近研究表明,无需任何配对数据即可有效微调 VLMs,特别是可利用大语言模型(LLMs)生成的纯文本训练数据来有效提升 VLMs 的视觉识别性能。本文深入探究这一令人振奋的纯文本 VLM 训练方法,并探索在从 LLMs 采样文本数据时考虑下游任务特性以显著进一步优化该方法的途径。具体而言,相较于最先进的纯文本 VLM 训练方法,我们展示了在(跨)域特定适应上最高 8.4% 的性能提升、在细粒度识别上最高 8.7% 的提升,以及相比强基线在零样本分类上 3.1% 的整体平均提升。
引用
@article{arxiv.2309.06809,
title = {TAP: Targeted Prompting for Task Adaptive Generation of Textual Training Instances for Visual Classification},
author = {M. Jehanzeb Mirza and Leonid Karlinsky and Wei Lin and Horst Possegger and Rogerio Feris and Horst Bischof},
journal= {arXiv preprint arXiv:2309.06809},
year = {2023}
}
备注
Code is available at: https://github.com/jmiemirza/TAP