暴露并缓解视觉问答解释中的不一致性:针对VQA-NLE的对抗性攻击
计算机视觉与模式识别
2025-08-19 v1 人工智能
计算与语言
摘要
自然语言解释(VQA-NLE)旨在通过阐明其决策过程来使黑箱模型更具透明度。然而,我们发现现有VQA-NLE系统可能产生不一致的解释,甚至在未真正理解底层上下文的情况下得出结论,这暴露了其推理管道或解释生成机制的弱点。为凸显这些漏洞,我们不仅利用现有的对抗策略扰动问题,还提出了一种最小化图像 alteration 以诱导矛盾或瞬时输出的新策略。我们进一步引入一种缓解方法,利用外部知识来缓解这些不一致性,从而增强模型的鲁棒性。在两个标准基准和两个广泛使用的VQA-NLE模型上的大量评估均表明,我们的攻击手段有效且知识基于的防御具有潜力,最终揭示了当前VQA-NLE系统在安全性和可靠性方面的紧迫关切。
引用
@article{arxiv.2508.12430,
title = {Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations},
author = {Yahsin Yeh and Yilun Wu and Bokai Ruan and Honghan Shuai},
journal= {arXiv preprint arXiv:2508.12430},
year = {2025}
}