针对多模态大语言模型的煤气灯否定攻击基准测试
计算与语言
2025-10-09 v4
摘要
多模态大语言模型在整合不同模态方面取得了显著进展,在复杂的理解和生成任务中表现出色。尽管取得了成功,但多模态大语言模型仍然容易受到对话式对抗输入的影响。在本文中,我们系统地研究了煤气灯否定攻击:一种现象,即模型尽管最初提供了正确答案,但被用户提供的否定说法说服而反转其输出,常常编造理由。我们在不同基准上对最先进的多模态大语言模型进行了广泛评估,并观察到引入否定后性能显著下降。值得注意的是,我们引入了第一个基准GaslightingBench,专门设计用于评估多模态大语言模型对否定论证的脆弱性。GaslightingBench由从现有数据集中整理的选择题以及跨20个不同类别生成的否定提示组成。通过广泛评估,我们发现专有模型如Gemini-1.5-flash和GPT-4o表现出比开源模型如Qwen2-VL和LLaVA更好的韧性,尽管即使是像Gemini-2.5-Pro这样的高级推理导向模型仍然容易受到攻击。我们的类别级分析进一步表明,主观或社会细微领域(例如社会关系、图像情感)特别脆弱,而更客观的领域(例如地理)表现出相对较小但仍然显著的下降。总体而言,所有评估的多模态大语言模型在煤气灯否定攻击下都难以保持逻辑一致性。这些发现突显了基本的鲁棒性差距,并为开发更可靠和值得信赖的多模态AI系统提供了见解。项目网站:https://yxg1005.github.io/GaslightingNegationAttacks/。
引用
@article{arxiv.2501.19017,
title = {Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models},
author = {Bin Zhu and Yinxuan Gui and Huiyan Qi and Jingjing Chen and Chong-Wah Ngo and Ee-Peng Lim},
journal= {arXiv preprint arXiv:2501.19017},
year = {2025}
}
备注
Project website: https://yxg1005.github.io/GaslightingNegationAttacks/