中文

面向安全关键型 LLM 助手的 Agent2Agent 威胁:人本导向的分类框架

人工智能 2026-02-06 v1 人机交互

摘要

将基于大语言模型(LLM)的对话式智能体集成到车辆中,使得智能助手在与外部服务通过诸如谷歌的 Agent-to-Agent(A2A)等协议进行协调时,面临着智能代理、汽车安全以及代理间通信交叉领域的新型安全挑战。这些智能助手通过自然语言有效载荷传递,这些攻击面可能导致从驾驶员分心到未经授权的车辆控制等严重后果。现有的 AI 安全框架虽然具有基础性贡献,但缺乏安全关键系统工程中严格的“关注点分离”标准,未能区分保护对象(资产)与攻击路径之间的概念。本文通过提出称为AgentHeLLM(Agent Hazard Exploration for LLM Assistants)的威胁建模框架,来弥补这一方法论差距,该框架正式区分资产识别与攻击路径分析。我们引入由以伤害导向的“受害者建模”衍生的、灵感来自《世界人权宣言》的人本资产分类法,以及一种形式化图模型,用于区分毒性路径(恶意数据传播)与触发路径(激活动作)。我们通过开源攻击路径建议工具AgentHeLLM Attack Path Generator演示了该框架的实际适用性,后者采用双层搜索策略自动化多阶段威胁发现。

关键词

引用

@article{arxiv.2602.05877,
  title  = {Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy},
  author = {Lukas Stappen and Ahmet Erkan Turan and Johann Hagerer and Georg Groh},
  journal= {arXiv preprint arXiv:2602.05877},
  year   = {2026}
}