AegisAgent:针对大语言模型驱动的人类活动识别中提示注入攻击的自主防御智能体
密码学与安全
2025-12-25 v1
摘要
大语言模型(LLM)与可穿戴感知的融合正在催生一类能够理解精细人类活动的新型移动应用。然而,这些系统的可靠性因其易受提示注入攻击而受到严重损害,攻击者会故意向LLM输入欺骗性指令。基于静态过滤器和刚性规则的传统防御措施不足以应对这些新型攻击的语义复杂性。我们认为需要进行范式转变——从被动过滤转向主动保护和自主推理。我们提出AegisAgent,这是一个旨在确保LLM驱动的人类活动识别(HAR)系统安全的自主智能体系统。AegisAgent不仅仅阻止威胁,而是充当认知守护者。它自主感知潜在的语义不一致性,通过查询过去交互的动态记忆来推理用户的真实意图,并通过生成和执行多步验证与修复计划来采取行动。我们将AegisAgent实现为一个轻量级的全栈原型,并在三个公开数据集上,使用五个最先进的基于LLM的HAR系统,对15种常见攻击进行了系统性评估。结果显示,它将攻击成功率平均降低了30%,同时在GPU工作站上仅产生78.6毫秒的延迟开销。我们的工作为构建安全可信的LLM驱动HAR系统迈出了第一步。
引用
@article{arxiv.2512.20986,
title = {AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs},
author = {Yihan Wang and Huanqi Yang and Shantanu Pal and Weitao Xu},
journal= {arXiv preprint arXiv:2512.20986},
year = {2025}
}