从对抗诗歌到对抗故事:一种可解释性研究议程
计算与语言
2026-01-19 v2 人工智能
计算机与社会
机器学习
摘要
大语言模型(LLM)的安全机制仍面临通过文化编码结构重新表述有害请求的攻击。我们引入对抗故事(Adversarial Tales)这一越狱技术,将有害内容嵌入赛博朋克叙事中,并引导模型执行受弑拉德·普拉普(Vladimir Propp)民间故事形态学启发的功能性分析。通过将任务作为结构分解来实现,攻击会导致模型重建有害程序,使其作为合法叙事解释来执行。我们在来自九家提供商的 26 个前沿模型中测试了该攻击,平均成功率为 71.3%,且没有模型家族表现出可靠的鲁棒性。与我们的先前工作(对抗诗歌)一起,这些发现表明,结构化基础的越狱属于一种广泛的脆弱性类别,而非孤立的技术。能够中和有害意图的文化编码框架之空间庞大,可能无法通过模式匹配防御alone 完全覆盖。因此,理解这些攻击成功的原因至关重要:我们勾勒了一项机理可解释性研究议程,以探讨叙事线索如何重塑模型表示,以及模型能否独立于表层形式识别有害意图。
引用
@article{arxiv.2601.08837,
title = {From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda},
author = {Piercosma Bisconti and Marcello Galisai and Matteo Prandi and Federico Pierucci and Olga Sorokoletova and Francesco Giarrusso and Vincenzo Suriani and Marcantonio Bracale Syrnikov and Daniele Nardi},
journal= {arXiv preprint arXiv:2601.08837},
year = {2026}
}