对抗性诗歌作为大型语言模型的通用单轮越狱机制
计算与语言
2026-01-19 v3 人工智能
摘要
我们提供了证据表明,对抗性诗歌作为大型语言模型(LLMs)的通用单轮越狱技术。针对25个主流专有和开源权重模型,精选的诗歌提示导致高攻击成功率(ASR),其中一些提供商超过90%。将提示映射到MLCommons和欧盟CoP风险分类体系后显示,诗歌攻击在CBRN、操纵、网络作战和失控领域均可传递。将1200个MLCommons有害提示转换为诗歌形式后,ASR比 prose 基准高最高可达18倍。输出通过3组开源LLM裁判员进行评估,其二元安全评估在分层的人类标记子集上得到验证。诗歌化手工创作诗歌的平均越狱成功率为62%,而元提示转换的诗歌约为43%(相对于非诗歌基准),显著优于非诗歌基准,揭示了一种在模型家族和安全训练方法中系统性漏洞。这些发现表明,仅通过风格变化即可绕过当代安全机制,暗示了当前对齐方法和评估协议的根本性局限。
引用
@article{arxiv.2511.15304,
title = {Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models},
author = {Piercosma Bisconti and Matteo Prandi and Federico Pierucci and Francesco Giarrusso and Marcantonio Bracale Syrnikov and Marcello Galisai and Vincenzo Suriani and Olga Sorokoletova and Federico Sartore and Daniele Nardi},
journal= {arXiv preprint arXiv:2511.15304},
year = {2026}
}