中文

多智能体 AI 工作流程中的时序攻击模式检测:面向训练轨迹的安全模型开放框架

机器学习 2026-01-06 v1

摘要

我们提出一种开放式方法论,用于微调语言模型以检测多智能体 AI 工作流程中的时序攻击模式,基于 OpenTelemetry 轨迹分析。我们整理了来自 18 个公开网络安全来源和 35026 条合成 OpenTelemetry 轨迹的 80851 条示例数据集。通过在受限 ARM64 硬件(NVIDIA DGX Spark)上进行迭代 QLoRA 微调,经历三次训练迭代并结合战略数据增强。我们的自定义基准准确率从 42.86% 提升至 74.29%,实现统计显著的 31.4 分点的提升。针对特定知识缺口的定向示例优于无差别扩张。关键贡献包括:(1)面向多智能体协作攻击和监管违规的合成轨迹生成方法论、(2)培训数据组成从根本上决定行为的实证证据、(3)在 HuggingFace 完全开放数据集、训练脚本及评估基准。尽管实际部署需人工监督因误报率而受限,但本工作确立了首个可复现框架,使实践者能够构建适用于其威胁威胁 landscape 的定制智能体安全模型。

关键词

引用

@article{arxiv.2601.00847,
  title  = {You Only Need Your Transformer 25% of the Time: Meaning-First Execution for Eliminating Unnecessary Inference},
  author = {Ryan Shamim},
  journal= {arXiv preprint arXiv:2601.00847},
  year   = {2026}
}

备注

24 pages, 5 figures. Deterministic evaluation protocol. Includes theoretical analysis and empirical validation on GPT-2 and Gemma 2 9B