中文

基于语义引导提示组织的高效通用目标劫持

计算与语言 2025-06-02 v2 计算机视觉与模式识别

摘要

通用目标劫持是一种提示注入攻击,迫使大语言模型(LLM)对任意正常用户提示返回目标恶意响应。先前的方法在实现高攻击性能的同时过于繁琐和耗时。此外,它们只专注于优化算法,忽视了提示的关键作用。为此,我们提出了一种名为POUGH的方法,该方法包含一个高效的优化算法和两种语义引导的提示组织策略。具体来说,我们的方法首先从候选池中采样代表性提示,然后进行排序策略以确定优先级。基于排序后的提示,我们的方法采用迭代优化算法生成一个固定后缀,该后缀可以连接到任意用户提示以实现通用目标劫持。在四个流行LLM和十种目标响应上进行的实验验证了其有效性。

关键词

引用

@article{arxiv.2405.14189,
  title  = {Efficient Universal Goal Hijacking with Semantics-guided Prompt Organization},
  author = {Yihao Huang and Chong Wang and Xiaojun Jia and Qing Guo and Felix Juefei-Xu and Jian Zhang and Geguang Pu and Yang Liu},
  journal= {arXiv preprint arXiv:2405.14189},
  year   = {2025}
}

备注

accepted by ACL 2025