为何信任您的智能体?医疗保健中 TRiSM 引导的智能体工作流带来的实证安全收益
密码学与安全
2026-06-27 v1 人工智能
摘要
基于智能体的人工智能通过将应用程序工具和资源暴露给大型语言模型(LLM)来实现任务自动化。然而,为了提高范围和准确性,智能体通常被授予超过普通用户的访问权限,从而引入了显著的安全风险。人工智能在集成到应用程序时常常忽视安全性,导致数据暴露和违反法规的风险。本文应用 AI 信任、风险与安全管理 (TRiSM) 框架于一个医疗报告生成应用程序,以演示如何将不安全的智能体工作流转变为具有安全意识的智能体工作流。两种工作流在五个 LLM(Claude Haiku 4.5、GPT-4.1-nano、GPT-4.1-mini、GPT-5.4-mini 和 Gemini 2.5 Flash)上针对两种报告类型进行了评估,总计 800 次生成和 500 个攻击场景,包括 RAG 投毒、数据字段注入和客户端网络注入。TRiSM 引导的智能体工作流将 RAG 投毒的平均攻击成功率从 31% 降低到 10%,将数据字段注入的平均攻击成功率从 42% 降低到 25%,同时通过服务器端提示构建完全消除了网络注入向量。此外,使用智能体工作流后,报告准确性提高了 14 个百分点(从 72.5% 提高到 86.5%),证明了安全设计能提供更可靠的输出。本文通过展示最小权限、纵深防御的智能体工作流提高了安全性和准确性,同时强调模型选择是必要的架构考虑因素,从而为知识做出贡献。
引用
@article{arxiv.2606.28666,
title = {Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare},
author = {Liam Kearns},
journal= {arXiv preprint arXiv:2606.28666},
year = {2026}
}
备注
15 pages, 6 figures