中文

视觉-语言基础模型上提示工程系统性综述

计算机视觉与模式识别 2023-07-25 v1

摘要

提示工程是一种通过向大型预训练模型添加任务特定的提示(称为 prompts)来使模型适应新任务的技术。提示可以手动创建为自然语言指令,或自动生成为自然语言指令或向量表示。提示工程能够仅基于提示进行预测而无需更新模型参数,并使得大型预训练模型在实际任务中更易应用。过去几年,提示工程在自然语言处理中已被充分研究。最近,它在视觉-语言建模中也得到了深入的研究。然而,目前缺乏对预训练视觉-语言模型上提示工程的系统性概述。本文旨在对三类视觉-语言模型上的前沿提示工程研究进行全面综述:多模态到文本生成模型(如 Flamingo)、图像-文本匹配模型(如 CLIP)和文本到图像生成模型(如 Stable Diffusion)。对于每类模型,我们总结并讨论了简要的模型概述、提示方法、基于提示的应用以及相应的责任与完整性问题。此外,还讨论了视觉-语言模型、语言模型和视觉模型上提示工程的共性与差异。我们总结了挑战、未来方向和研究机会,以促进该主题的后续研究。

关键词

引用

@article{arxiv.2307.12980,
  title  = {A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models},
  author = {Jindong Gu and Zhen Han and Shuo Chen and Ahmad Beirami and Bailan He and Gengyuan Zhang and Ruotong Liao and Yao Qin and Volker Tresp and Philip Torr},
  journal= {arXiv preprint arXiv:2307.12980},
  year   = {2023}
}