中文

隐晦但有效:基于生物启发搜索的古文中文 Jailbreak 提示优化

人工智能 2026-03-25 v3 密码学与安全

摘要

随着大语言模型(LLM)的日益普及,其安全风险正受到日益关注的注意。现有研究表明,LLM 对 jailbreak 攻击极其敏感,有效性在不同语言上下文中有所不同。本文探讨古文中文在 jailbreak 攻击中的作用。凭借其简洁性和隐晦性,古文中文可部分绕过现有的安全约束,暴露了 LLM 的显著漏洞。基于此观察,本文提出了一个框架 CC-BOS,用于基于多维水果虫优化生成古文中文对抗提示,实现黑盒环境中高效且自动化的 jailbreak 攻击。提示被编码为八个政策维度——涵盖角色、行为、机制、隐喻、表达、知识、触发模式和上下文;并通过嗅搜索、视觉搜索和 Cauchy 变异进行迭代细化。这一设计使我们能够高效地探索搜索空间,从而增强黑盒 jailbreak 攻击的有效性。为增强可读性和评估准确性,我们进一步设计了一个古文中文到英文翻译模块。大量实验表明,所提出的 CC-BOS 持续优于现有的 jailbreak 攻击方法。

关键词

引用

@article{arxiv.2602.22983,
  title  = {Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search},
  author = {Xun Huang and Simeng Qin and Xiaoshuang Jia and Ranjie Duan and Huanqian Yan and Zhitao Zeng and Fei Yang and Yang Liu and Xiaojun Jia},
  journal= {arXiv preprint arXiv:2602.22983},
  year   = {2026}
}

备注

ICLR 2026 Poster The source code relevant to this article has now been open-sourced; for details, please visit: https://github.com/xunhuang123/CC-BOS