中文

通过语义漂移分析检测大语言模型中的睡眠代理

人工智能 2025-11-21 v1

摘要

大语言模型(LLMs)可以在训练期间看似安全,但在特定部署条件下 exhibits 恶意行为,这种现象称为“睡眠代理”。Hubinger 等人最近的工作表明,这些后门会通过安全训练持久化,但目前尚无实用的检测方法。我们提出了一种新型双方法检测系统,结合语义漂移分析和 canary 基线比较,以实时识别后门 LLMs。该方法使用 Sentence-BERT 嵌入测量与安全基线之间的语义偏移,同时注入 canary 提问监控响应一致性。在评估官方 Cadenza-Labs dolphin-llama3-8B 睡眠代理模型时,我们的系统 achieves 92.5% 的准确率,100% 的精确率(零误报),85% 的召回率。该组合检测方法实时运行(每个查询 <1秒),无需模型修改,为 LLM 后门检测提供了第一个实用解决方案。我们的工作填补了 AI 部署中的关键安全差距,表明基于嵌入的检测方法能够有效识别 deceptive 模型行为,同时不牺牲部署效率。

关键词

引用

@article{arxiv.2511.15992,
  title  = {Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis},
  author = {Shahin Zanbaghi and Ryan Rostampour and Farhan Abid and Salim Al Jarmakani},
  journal= {arXiv preprint arXiv:2511.15992},
  year   = {2025}
}

备注

7 pages, 3 figures, 1 table