注意力机制并非唯一需要的隐喻
计算与语言
2026-05-13 v1 计算机与社会
摘要
大型语言模型正在越来越多地部署在安全关键型应用中,其抵抗有害指令的能力至关重要。尽管后训练旨在使模型对许多越狱策略保持鲁性,但近期证据表明,诸如诗歌转化等风格化改写仍能以令人警惕的有效性绕过安全机制。这引出一个核心问题:为何文学式越狱得以成功?本文通过注意力模式的可解释性分析,探讨其有效性是否依赖于特定诗意手法、是否因模型未能识别文学格式,或是否源于模型处理风格化不规则提示的深层方式的改变。我们通过输入层消除实验评估单个和组合诗意手法的贡献;构建注意力图的可解释向量表示;对这些表示进行聚类并训练线性探针以预测安全结果和文学格式。我们的结果表明,模型对诗歌与散文格式的区分准确率很高,但在每种格式内部难以预测越狱成功情况。聚类进一步显示,按文学格式清晰分离,但按安全标签分离不明显。这些发现表明,越狱成功并非因模型未能识别诗歌格式;相反,诗歌提示诱导模型产生独立于有害内容检测的不同处理模式。总体而言,文学式越狱似乎通过累积的风格化不规则性扰乱大型语言模型的处理方式,而非通过单一诗意手法。由于这种方式改变了提示的处理方式,使得模型规避了在后训练期间考虑的词汇触发器,因此安全鲁性需要考虑风格引起的模型行为变化。我们以Qwen3-14B为代表性开源模型进行案例研究。
引用
@article{arxiv.2605.12128,
title = {Metaphor Is Not All Attention Needs},
author = {Olga Sorokoletova and Francesco Giarrusso and Giacomo De Luca and Piercosma Bisconti and Matteo Prandi and Federico Pierucci and Marcello Galisai and Vincenzo Suriani and Daniele Nardi},
journal= {arXiv preprint arXiv:2605.12128},
year = {2026}
}