Prompt Highlighter:多模态大语言模型的交互式控制
计算机视觉与模式识别
2024-03-22 v2 计算与语言
摘要
本研究针对多模态大语言模型(LLMs与VLMs)推理的一个关键方面:显式可控的文本生成。多模态大语言模型赋予了多模态理解能力与语义生成能力,但由于其自回归生成特性,带来了较低的可解释性以及对提示内容的更强依赖。尽管调整提示格式可改善输出,但针对每个任务设计具体而精确的提示可能颇具挑战且效率低下。为解决此问题,我们引入一种新颖的推理方法Prompt Highlighter,其允许用户高亮特定提示片段,以交互式控制生成过程中的关注焦点。受无分类器扩散引导启发,我们基于高亮令牌构建正则与无条件上下文对,证明模型中的自回归生成可以以无分类器方式被引导。值得注意的是,我们发现,在推理过程中,通过注意力权重以高亮令牌引导模型可得到更理想的输出。我们的方法兼容当前的LLMs与VLMs,无需训练即可实现令人印象深刻的定制化生成结果。实验证实了其在聚焦输入上下文与生成可靠内容方面的有效性。无需在LLaVA-v1.5上微调,我们的方法在MMBench测试中取得70.7分,在MME-perception中取得1552.5分。代码见:https://github.com/dvlab-research/Prompt-Highlighter/
引用
@article{arxiv.2312.04302,
title = {Prompt Highlighter: Interactive Control for Multi-Modal LLMs},
author = {Yuechen Zhang and Shengju Qian and Bohao Peng and Shu Liu and Jiaya Jia},
journal= {arXiv preprint arXiv:2312.04302},
year = {2024}
}
备注
CVPR 2024; Project Page: https://julianjuaner.github.io/projects/PromptHighlighter