中文

TRYLOCK:通过分层偏好与表示工程构建针对 LLM Jailbreak 的深度防御

密码学与安全 2026-01-08 v1 机器学习

摘要

大型语言模型仍然 vulnerable to jailbreak attacks,单层防御往往在安全性与可用性之间牺牲 tradeoff。我们提出 TRYLOCK,首个将四种异构机制跨推理栈集成的防御架构:通过 DPO 实现 weight-level safety alignment,通过 Representation Engineering (RepE) steering 实现 activation-level control,通过轻量侧车分类器选择自适应 steering strength,通过输入 canonicalization 中和基于编码的绕过。针对使用 Mistral-7B-Instruct 评估的 249 提示攻击集合(覆盖五大攻击族),TRYLOCK 实现了 88.0% 的相对 ASR 降低(46.5% 降至 5.6%),每一层贡献独特的覆盖率:RepE 可阻挡 DPO 单独使用时 36% 的攻击,while canonicalization 可捕获 14% 那些规避 DPO 和 RepE 的编码攻击。我们发现 steering 存在非单调现象——intermediate strength (alpha=1.0) 会在基线以下降低安全性——并提供解释 RepE-DPO interference 的机制性假设。该自适应侧车将拒绝率从 60% 降至 48%,同时维持相同的攻击防御能力,表明安全性与可用性不必互斥。我们发布所有组件——训练好的适配器、steering 向量、侧车分类器、偏好对和完整评估方法论——实现完全可复现。

关键词

引用

@article{arxiv.2601.03300,
  title  = {TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering},
  author = {Scott Thornton},
  journal= {arXiv preprint arXiv:2601.03300},
  year   = {2026}
}

备注

14 pages, 4 figures. Code and datasets at https://github.com/scthornton/trylock