中文

ConES:用于大型视觉语言模型参数高效调优的概念嵌入搜索

计算机视觉与模式识别 2023-05-31 v1

摘要

大型预训练视觉-语言模型已展现出卓越能力,可通过适当的提示或调优将已获取的知识迁移到各种领域和下游任务中。现有主流调优方法大致可分为三类:1)通过创建合适的提示文本进行提示工程,该方法耗时且需要领域专业知识;2)或简单地微调整个模型,该方法效率极低;3)通过带参数化的提示嵌入配合文本编码器进行提示调优。然而,所有方法都依赖文本编码器来弥合视觉与语言之间的模态鸿沟。在本文中,我们质疑这一繁琐文本编码器的必要性,以寻求更轻量、高效的调优范式,以及更贴近图像表示的更具代表性的提示嵌入。为此,我们提出概念嵌入搜索(ConES)方法,通过优化提示嵌入——无需文本编码器——借助多种任务目标来捕捉图像模态的“概念”。通过舍弃文本编码器,我们能够显著加快学习过程,例如,在我们的个性化文本到图像生成实验中,从约一小时缩短至仅十分钟,且不损害生成质量。此外,我们提出的方法与当前现有调优方法正交,因为搜索得到的概念嵌入可进一步用于下一阶段微调预训练大型模型以提升性能。大量实验表明,我们的方法在包括目标检测、实例分割和图像生成在内的多种下游任务中优于提示调优和文本反转方法。我们的方法在专业领域(如医学领域)中对未见概念也展现出更好的泛化能力。

关键词

引用

@article{arxiv.2305.18993,
  title  = {ConES: Concept Embedding Search for Parameter Efficient Tuning Large Vision Language Models},
  author = {Huahui Yi and Ziyuan Qin and Wei Xu and Miaotian Guo and Kun Wang and Shaoting Zhang and Kang Li and Qicheng Lao},
  journal= {arXiv preprint arXiv:2305.18993},
  year   = {2023}
}