放大器提示:通过极简指令解决多模态幻觉
计算与语言
2025-02-24 v2 人工智能
计算机视觉与模式识别
多媒体
摘要
多模态大语言模型(MLLMs)中的幻觉现象阻碍了其实际应用。为此,我们提出了一种名为放大器提示(MagPrompt)的简单且高效的方法,通过极简指令来解决 MLLMs 中的幻觉问题。MagPrompt 基于以下两个关键原则,这些原则指导了各种有效提示的设计,显示出良好的鲁棒性:(1)MLLMs 应更关注图像;(2)当图像与模型内部知识存在冲突时,MLLMs 应优先考虑图像。MagPrompt 无需训练,可应用于开源和闭源模型,如 GPT-4o 和 Gemini-pro。它在多个数据集上表现良好,其效果相当于甚至优于诸如 VCD 等更复杂的方法。此外,我们的提示设计原则和实验分析提供了关于多模态幻觉的宝贵见解。
引用
@article{arxiv.2410.11701,
title = {Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions},
author = {Yuhan Fu and Ruobing Xie and Jiazhen Liu and Bangxiang Lan and Xingwu Sun and Zhanhui Kang and Xirong Li},
journal= {arXiv preprint arXiv:2410.11701},
year = {2025}
}
备注
The proposed method does not work for up-to-date MLLMs.