中文

有害提示混淆:基于归纳法和符号编码的LLM越狱

人工智能 2025-09-16 v1 计算与语言

摘要

大型语言模型(LLM)在 diverse 任务中展现出惊人的能力,但其用于有害目的的潜在滥用仍是重大关切。为强化对此类漏洞的防御,必须调查利用LLM架构和学习范式内在弱点的通用越狱攻击。为此,我们提出了一种新型且广泛适用的有害提示混淆(HaPLa)技术,仅需对目标模型进行黑盒访问即可实现。HaPLa包含两种主要策略:1)归纳式框架化,指示LLM推断达到有害活动的合理中间步骤,而非直接响应明确的有害查询;2)符号编码,一种轻量且灵活的 approach,旨在混淆有害内容,由于当前LLM主要对明确的有害关键词敏感。实验结果表明,HaPLa在GPT系列模型上实现超过95%的攻击成功率,覆盖所有目标时达70%。进一步的分析通过多样化的符号编码规则也揭示了一个根本挑战:在显著降低对善意查询的帮助性响应能力方面,安全调优LLM仍然困难。

关键词

引用

@article{arxiv.2509.10931,
  title  = {Harmful Prompt Laundering: Jailbreaking LLMs with Abductive Styles and Symbolic Encoding},
  author = {Seongho Joo and Hyukhun Koh and Kyomin Jung},
  journal= {arXiv preprint arXiv:2509.10931},
  year   = {2025}
}

备注

EMNLP 2025