中文

针对推理模型的煤气灯否定攻击基准测试

量子物理 2025-06-12 v1 广义相对论与量子宇宙学

摘要

近期以推理为中心模型的进展承诺通过链式思维提示和测试时缩放等机制提高鲁棒性。然而,它们抵御煤气灯否定攻击——即自信地否认正确答案的对抗性提示——的能力仍未被充分探索。在本文中,我们对三种最先进的推理模型——OpenAI的o4-mini、Claude-3.7-Sonnet和Gemini-2.5-Flash——在三个多模态基准——MMMU、MathVista和CharXiv——上进行了系统性评估。我们的评估显示,在煤气灯否定攻击后准确率平均下降25–29%,表明即使是最顶级的推理模型也难以在操纵性用户反馈下保持正确答案。基于评估的洞察并为进一步探究这一脆弱性,我们引入了GaslightingBench-R,一个专门用于评估推理模型在煤气灯否定攻击下捍卫其信念能力的新诊断基准。该基准通过筛选和整理现有基准中的1025个具有挑战性样本构建而成,GaslightingBench-R诱发了更剧烈的失败,平均准确率下降超过53%。我们的发现揭示了逐步推理与抵抗对抗操纵之间的根本差距,呼吁新的鲁棒性策略来保护推理模型免受煤气灯否定攻击。

关键词

引用

@article{arxiv.2506.09678,
  title  = {Black hole/quantum machine learning correspondence},
  author = {Jae-Weon Lee and Zae Young Kim},
  journal= {arXiv preprint arXiv:2506.09678},
  year   = {2025}
}