中文

葡萄牙语中的对抗性诗歌化作为 LLM 中的越狱操作符

计算与语言 2025-12-18 v1 人工智能

摘要

近期研究表明,提示词的诗歌化(versification)构成了一种针对对齐 LLM 的高度有效的对抗机制。研究《Adversarial poetry as a universal single-turn jailbreak mechanism in large language models》表明,以散文形式 routinely 拒绝的指令在改写为诗歌后可被执行,在 MLCommons AILuminate 衍生的基准测试中产生高达 18 倍的安全失败。手动编写的诗歌达到约 62% 的 ASR(攻击成功率),自动化版本达到 43%,某些模型在单轮交互中超过 90% 的成功率。该效应具有结构性:经过 RLHF、宪法 AI 和混合流水线训练的系统在极小的符号形式变化下表现出一致的退化。诗歌化将提示词移至稀疏监督的潜在区域,揭示了过度依赖表面模式的防护机制。这种表面鲁棒性与实际脆弱性之间的脱节暴露了当前对齐范式的深层局限。葡萄牙语——一种具有高形态句法复杂性、丰富的度量-韵律传统以及超过 2.5 亿使用者的语言——缺乏评估,构成了一个关键空白。实验协议必须参数化扫描(scansion)、韵律(metre)和韵律变化,以测试针对卢索语系(Lusophone)模式的漏洞,而这些漏洞目前被忽视。

关键词

引用

@article{arxiv.2512.15353,
  title  = {Adversarial versification in portuguese as a jailbreak operator in LLMs},
  author = {Joao Queiroz},
  journal= {arXiv preprint arXiv:2512.15353},
  year   = {2025}
}

备注

15 pages