意图隐蔽:一种博弈论分析
计算与语言
2025-08-19 v2
摘要
随着大语言模型(LLM)能力的不断提升,关于其安全部署的担忧也日益增长。尽管已引入对齐机制来阻止滥用,但它们仍然容易受到精心设计的对抗性提示的攻击。本文提出了一种可扩展的攻击策略:意图隐藏式对抗性提示,通过技能的组合来隐藏恶意意图。我们构建了一个博弈论框架来建模此类攻击与应用提示和响应过滤的防御系统之间的相互作用。我们的分析识别了平衡点,并揭示了攻击者的结构性优势。为对抗这些威胁,我们提出并分析了一种针对意图隐藏攻击的防御机制。实证结果表明,该攻击在多个真实世界的 LLM 上针对多种恶意行为均显示出优于现有对抗性提示技术的明显优势。
引用
@article{arxiv.2505.20841,
title = {Concealment of Intent: A Game-Theoretic Analysis},
author = {Xinbo Wu and Abhishek Umrawal and Lav R. Varshney},
journal= {arXiv preprint arXiv:2505.20841},
year = {2025}
}