中文

Doppelganger 方法:通过基于提示的可迁移对抗攻击破坏 LLM 智能体的角色一致性

人工智能 2025-06-27 v2 密码学与安全

摘要

自大型语言模型问世以来,提示工程已使能够快速、低成本地创建多样化的自治智能体在实际应用中广泛使用。然而,这种便利性带来了关于底层提示在安全性、鲁棒性和行为一致性方面的紧迫关注,以及阻止这些提示被用户尝试窥探的 pressing 挑战。本文提出了“Doppelganger 方法”,以展示智能体被劫持、暴露系统指令和内部信息的风险。随后,我们定义了“在对抗迁移下的提示对齐崩溃(PACAT)”水平,用于评估该对抗迁移攻击的脆弱性。我们还提出了“针对对抗迁移的警示(CAT)”提示,以抵御 Doppelganger 方法。实验结果表明,Doppelganger 方法能够破坏智能体的一致性并暴露其内部信息。相比之下,CAT 提示能够有效防御此类对抗攻击。

关键词

引用

@article{arxiv.2506.14539,
  title  = {Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack},
  author = {Daewon Kang and YeongHwan Shin and Doyeon Kim and Kyu-Hwan Jung and Meong Hi Son},
  journal= {arXiv preprint arXiv:2506.14539},
  year   = {2025}
}