多模态大语言模型中的视觉提示:综述
机器学习
2024-09-25 v1 计算机视觉与模式识别
摘要
多模态大语言模型 (MLLM) 为预训练的大型语言模型 (LLM) 增添了视觉能力。虽然在 LLM 中已广泛研究文本提示,但视觉提示近期在实现更细粒度和灵活的视觉指令方面日益受到关注。本文是视觉提示方法在 MLLM 领域的第一篇综合性综述,聚焦于视觉提示、提示生成、组合推理和提示学习。我们对现有视觉提示进行分类,讨论针对图像生成自动提示注释的方法。我们还审视了实现视觉编码器与 backbone LLM 更好对齐的视觉提示方法,涉及 MLLM 的视觉 grounding、对象指涉和组合推理能力。此外,我们总结了提升 MLLM 对视觉提示感知与理解能力的模型训练和 in-context 学习方法。本文审查了在 MLLM 中开发的视觉提示方法,并展望了这些方法的未来发展。
引用
@article{arxiv.2409.15310,
title = {Visual Prompting in Multimodal Large Language Models: A Survey},
author = {Junda Wu and Zhehao Zhang and Yu Xia and Xintong Li and Zhaoyang Xia and Aaron Chang and Tong Yu and Sungchul Kim and Ryan A. Rossi and Ruiyi Zhang and Subrata Mitra and Dimitris N. Metaxas and Lina Yao and Jingbo Shang and Julian McAuley},
journal= {arXiv preprint arXiv:2409.15310},
year = {2024}
}
备注
10 pages