跨 LLM 行为后门检测的泛化性研究
密码学与安全
2025-11-26 v1 人工智能
机器学习
摘要
随着 AI 代理在企业工作流程中的日益重要,其依赖共享工具库和预训练组件,导致了重大的供应链安全隐患。虽然先前的工作已在单个 LLM 架构内部 demonstrate 了行为后门检测,但跨 LLM 的泛化问题尚未得到探讨,这一空白对于部署多个 AI 系统的组织具有严重的实际意义。我们首次系统性地研究了跨 LLM 的行为后门检测,在六个生产级 LLM(GPT-5.1、Claude Sonnet 4.5、Grok 4.1、Llama 4 Maverick、GPT-OSS 120B 和 DeepSeek Chat V3.1)之间进行评估。通过 1,198 条执行轨迹和 36 项跨模型实验,我们量化了一个关键发现:单模型检测器在其训练分布内的准确率为 92.7%,但在不同 LLM 之间仅为 49.2%,相当于随机猜测的 43.4 个百分点泛化差距。我们的分析揭示,这一差距源于模型特定的行为特征,特别是时间特征(变异系数 > 0.8),而结构特征在不同架构之间保持稳定。我们表明,融合模型身份作为额外特征的模型感知检测方法,可在所有评估模型上实现 90.6% 的准确率。我们发布了多 LLM 轨迹数据集和检测框架,以支持可重复的研究。
引用
@article{arxiv.2511.19874,
title = {Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains},
author = {Arun Chowdary Sanna},
journal= {arXiv preprint arXiv:2511.19874},
year = {2025}
}
备注
10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces