中文

放大器提示:通过极简指令解决多模态幻觉

计算与语言 2025-02-24 v2 人工智能 计算机视觉与模式识别 多媒体

摘要

多模态大语言模型(MLLMs)中的幻觉现象阻碍了其实际应用。为此,我们提出了一种名为放大器提示(MagPrompt)的简单且高效的方法,通过极简指令来解决 MLLMs 中的幻觉问题。MagPrompt 基于以下两个关键原则,这些原则指导了各种有效提示的设计,显示出良好的鲁棒性:(1)MLLMs 应更关注图像;(2)当图像与模型内部知识存在冲突时,MLLMs 应优先考虑图像。MagPrompt 无需训练,可应用于开源和闭源模型,如 GPT-4o 和 Gemini-pro。它在多个数据集上表现良好,其效果相当于甚至优于诸如 VCD 等更复杂的方法。此外,我们的提示设计原则和实验分析提供了关于多模态幻觉的宝贵见解。

关键词

引用

@article{arxiv.2410.11701,
  title  = {Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions},
  author = {Yuhan Fu and Ruobing Xie and Jiazhen Liu and Bangxiang Lan and Xingwu Sun and Zhanhui Kang and Xirong Li},
  journal= {arXiv preprint arXiv:2410.11701},
  year   = {2025}
}

备注

The proposed method does not work for up-to-date MLLMs.