基准化气谣言否定攻击对推理模型的评估
计算机视觉与模式识别
2025-12-18 v2 人工智能
摘要
近期推理中心模型的进展通过链式思考提示和测试时扩缩等机制,承诺提高鲁棒性。然而,这些模型抵御气谣言否定攻击的能力——即自信否定正确答案的对抗性提示——仍未得到充分探索。本文对三种最先进的推理模型,即 OpenAI 的 o4-mini、Claude-3.7-Sonnet 和 Gemini-2.5-Flash,在三个多模态基准测试(MMMU、MathVista 和 CharXiv)上进行系统评估。我们的评估显示,气谣言否定攻击导致准确率显著下降(平均下降 25-29%),表明即便是顶尖推理模型在操纵性用户反馈下也难以保持正确答案。基于评估洞见,为进一步探究这一脆弱性,我们引入 GaslightingBench-R,一个新型诊断性基准,专为评估推理模型在气谣言否定攻击下捍卫信念的易受性而设计。通过筛选和精选现有基准中的 1,025 个具有挑战性的样本构建的 GaslightingBench-R 诱发更剧烈的失败,准确率平均下降超过 53%。我们的发现凸显了逐步推理与抵抗对抗性操纵之间的根本性差距,呼吁针对气谣言否定攻击构建新的鲁棒性策略,以保障推理模型。
引用
@article{arxiv.2506.09677,
title = {Benchmarking Gaslighting Negation Attacks Against Reasoning Models},
author = {Bin Zhu and Hailong Yin and Jingjing Chen and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2506.09677},
year = {2025}
}