中文

利用认知偏差的协同效应规避 LLM 的安全机制

计算与语言 2025-11-18 v2 人工智能 机器学习

摘要

大型语言模型 (LLM) 在广泛的任务中展现出惊人的能力,但其安全机制仍然容易受到利用认知偏差(系统偏离理性判断的偏差)进行的对抗攻击。与之前关注提示工程或算法操控的作弊方法不同,本工作强调了多认知偏差相互作用在削弱 LLM 安全防护方素被忽视的力量。我们提出了CognitiveAttack—a 新颖的红队测试框架,系统性地利用单一和组合认知偏差。通过集成监督微调和强化学习,CognitiveAttack 生成嵌入优化偏差组合的提示,从而在保持高攻击成功率的同时,有效规避安全协议。实验结果显示,该方法在 30 个不同 LLM 上暴露出显著的脆弱性,尤其是开源模型。CognitiveAttack 的攻击成功率显著高于当前最先进的黑盒方法 PAP (60.1% vs. 31.6%),揭示了当前防御机制的关键局限性。这些发现表明,多偏差相互作用是一种强大且尚未充分探索的攻击向量。本工作通过桥接认知科学与 LLM 安全,引入了一种新颖的跨学科视角,为构建更健壮且符合人类取向的 AI系统铺平了道路。

关键词

引用

@article{arxiv.2507.22564,
  title  = {Exploiting Synergistic Cognitive Biases to Bypass Safety in LLMs},
  author = {Xikang Yang and Biyu Zhou and Xuehai Tang and Jizhong Han and Songlin Hu},
  journal= {arXiv preprint arXiv:2507.22564},
  year   = {2025}
}