AGENTSAFE:面向智能体AI的伦理保障与治理统一框架
多智能体系统
2025-12-04 v1 新兴技术
摘要
大型语言模型(LLM)基于的智能体快速部署引入了新的风险类别,其能力允许自主规划、多步骤工具集成以及涌现式交互。现有治理方法面临风险因素,因而保持碎片化:现有框架要么是静态分类法导向,要么缺乏从风险识别到操作保障的集成端到端管道,尤其是针对智能体平台。我们提出AGENTSAFE,一个面向LLM基于智能体系统的实用治理框架。该框架将AI风险储存库 operationalized为设计、运行和审计控制,为风险识别和保障提供治理框架。该框架概述了agentic loops(计划->行动->观察->反思)和工具链, 将风险映射到结构化的分类法中,扩展了包含智能体特定漏洞的分类。它引入了限制高风险行为的保障措施,将高影响行动升级为人类监督,并通过覆盖安全、隐私、公平性和系统安全等场景银行进行系统评估。在部署期间,AGENTSAFE通过语义遥测、动态授权、异常检测和可中断机制确保持续治理。通过加密追踪和组织控制强化了来源和问责,实现智能体AI系统生命周期的可衡量、可审计的保障。本文的关键贡献包括:(1) 将风险分类法转化为可操作的设计、运行和审计控制的统一治理框架;(2) 提供可衡量的预部署保障的智能体安全评估方法;(3) 一套运行时治理和问责机制,制度化智能体AI生态系统的信任。
引用
@article{arxiv.2512.03180,
title = {AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI},
author = {Rafflesia Khan and Declan Joyce and Mansura Habiba},
journal= {arXiv preprint arXiv:2512.03180},
year = {2025}
}
备注
12 pages, 1 figure