中文

通过提示增强与字幕利用有效增强视觉语言大模型

计算机视觉与模式识别 2024-09-24 v1

摘要

最近的研究表明,视觉语言大模型(VLLM)可能输出与输入图像无关的内容。这一问题被称为幻觉现象,无疑会降低 VLLM 的性能。因此,人们提出了各种反幻觉技术,以使模型输出更加合理和准确。尽管取得了一定成功,但通过大量测试我们发现,增强提示(例如追加词汇、重写和拼写错误等)可能会改变模型输出并使输出再次产生幻觉。为了克服这一缺陷,我们提出了一种名为提示增强与字幕利用(PACU)的新指令微调框架,以提升 VLLM 在增强提示场景下的生成能力。具体而言,一方面,PACU 利用现有的 LLM 自动增强和评估多样化的提示。生成的高质量提示被用于增强 VLLM 处理不同提示的能力。另一方面,PACU 利用图像字幕与图像特征及提示共同作用以生成响应。当视觉特征不准确时,LLM 可以从图像字幕中捕获有用信息以生成响应。在幻觉评估和提示增强数据集上的大量实验表明,我们的 PACU 方法可以与现有方案良好配合,有效提升 VLLM 模型性能。代码可在 https://github.com/zhaominyiz/PACU 获取。

关键词

引用

@article{arxiv.2409.14484,
  title  = {Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization},
  author = {Minyi Zhao and Jie Wang and Zhaoyang Li and Jiyuan Zhang and Zhenbang Sun and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:2409.14484},
  year   = {2024}
}