欺骗你的多模态大语言模型有多容易?关于欺骗性提示的实证分析
计算机视觉与模式识别
2024-07-24 v2 计算与语言
摘要
多模态大语言模型(MLLMs)的显著进步并未使其免受挑战,特别是在处理提示中的欺骗性信息方面,从而在此类条件下产生幻觉响应。为了定量评估这种脆弱性,我们提出了 MAD-Bench,这是一个精心策划的基准测试,包含 1000 个测试样本,分为 5 个类别,如不存在的物体、物体数量和空间关系。我们对流行的 MLLMs 进行了全面分析,范围从 GPT-4v、Reka、Gemini-Pro 到开源模型,如 LLaVA-NeXT 和 MiniCPM-Llama3。实证观察显示,GPT-4o 与其他模型之间存在显著的性能差距;此前经过鲁棒指令微调的模型在这个新基准测试上效果不佳。虽然 GPT-4o 在 MAD-Bench 上达到了 82.82% 的准确率,但我们实验中任何其他模型的准确率范围仅在 9% 到 50% 之间。我们进一步提出了一种补救措施,即在欺骗性提示中添加一个额外的段落,以鼓励模型在回答问题前三思。令人惊讶的是,这种简单的方法甚至可以将准确率提高一倍;然而,绝对数值仍然太低,无法令人满意。我们希望 MAD-Bench 能作为一个有价值的基准,激发进一步的研究,以增强模型对欺骗性提示的弹性。
引用
@article{arxiv.2402.13220,
title = {How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts},
author = {Yusu Qian and Haotian Zhang and Yinfei Yang and Zhe Gan},
journal= {arXiv preprint arXiv:2402.13220},
year = {2024}
}