中文

TwinGate:通过非对称对比学习对不可追踪流量中的分解式越狱攻击进行有状态防御

密码学与安全 2026-05-01 v1 计算与语言 机器学习

摘要

分解式越狱攻击对大语言模型(LLM)构成严重威胁,它允许攻击者将一个恶意目标分解为一系列看似无害的查询,这些查询共同重构出被禁止的内容。在现实世界部署中,LLM面临着一个连续的、不可追踪的、完全匿名且任意交织的请求流,其中渗透着隐蔽分布的对抗性查询。在这种严格的威胁模型下,最先进的防御策略暴露出根本性的局限性。由于缺乏可信的用户元数据,它们无法追踪全局历史上下文,同时它们部署的用于实时监控的生成模型引入了计算上难以承受的开销。为了解决这个问题,我们提出了TwinGate,一个有状态的双编码器防御框架。TwinGate采用非对称对比学习(ACL)将语义不同但意图匹配的恶意片段聚类到一个共享的潜在空间中,而一个并行的冻结编码器则抑制由良性主题重叠引起的误报。每个请求只需要一次轻量级的前向传递,使防御能够与目标模型的预填充阶段并行执行,延迟开销可忽略不计。为了评估我们的方法并推动未来研究,我们构建了一个包含超过362万条指令、涵盖8600个不同恶意意图的综合数据集。在严格因果协议下对这个大规模语料库进行评估,TwinGate在实现高恶意意图召回率的同时,保持了极低的误报率,并且对自适应攻击保持高度鲁棒性。此外,我们的方案在吞吐量和延迟方面均大幅优于有状态和无状态基线。

关键词

引用

@article{arxiv.2604.27861,
  title  = {TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning},
  author = {Bowen Sun and Chaozhuo Li and Yaodong Yang and Yiwei Wang and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2604.27861},
  year   = {2026}
}