中文

层流假说:通过大型语言模型中的语义湍流检测越狱

机器学习 2025-12-17 v1 人工智能

摘要

随着大型语言模型(LLM)变得无处不在,保护其免受对抗性“越狱”攻击的挑战日益加剧。当前的防御策略通常依赖于计算成本高昂的外部分类器或脆弱的词法过滤器,忽略了模型推理过程的内在动态。本文引入了层流假说,该假说认为良性输入在 LLM 的高维潜空间中诱导出平滑、渐进的过渡,而对抗性提示则触发混乱、高方差的轨迹——称为语义湍流——这是由安全对齐与指令遵循目标之间的内部冲突引起的。这一现象通过一种新颖的零样本度量来形式化:逐层余弦速度的方差。在多种小型语言模型上的实验评估揭示了显著的诊断能力。经过 RLHF 对齐的 Qwen2-1.5B 在攻击下表现出统计学上显著的 75.4% 湍流增加(p < 0.001),验证了内部冲突假说。相反,Gemma-2B 表现出 22.0% 的湍流减少,表征了一种独特的、低熵的“基于反射”的拒绝机制。这些发现表明,语义湍流不仅可以作为轻量级的实时越狱检测器,还可以作为对黑盒模型底层安全架构进行分类的非侵入性诊断工具。

关键词

引用

@article{arxiv.2512.13741,
  title  = {The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models},
  author = {Md. Hasib Ur Rahman},
  journal= {arXiv preprint arXiv:2512.13741},
  year   = {2025}
}