从治理规范到可强制执行的控制:智能体 AI 运行时护栏的分层翻译方法
人工智能
2026-04-08 v1 人机交互
机器学习
多智能体系统
摘要
智能体 AI 系统进行规划、使用工具、维护状态,并产生具有外部效应的多步轨迹。这些特性产生了一个与单轮生成 AI 截然不同的治理问题:重要风险在执行过程中出现,而不仅在模型开发或部署时。因此,治理标准如 ISO/IEC 42001、ISO/IEC 23894、ISO/IEC 42005、ISO/IEC 5338、ISO/IEC 38507 以及 NIST AI 风险管理框架与智能体 AI 高度相关,但它们本身并不能产生可实现的运行时护栏。本文提出了一种分层翻译方法,将源自标准的治理目标连接到四个控制层:治理目标、设计时约束、运行时调解和保障反馈。它区分了治理目标、技术控制、运行时护栏和保障证据;引入了控制元组和运行时可执行性评分标准用于层分配;并在一个采购智能体案例研究中展示了该方法。核心主张是适度的:标准应指导控制在架构、运行时策略、人工升级和审计方面的布局,而运行时护栏则保留给那些具有可观测性、确定性且时间敏感性足够强、以证明执行时干预合理性的控制。
引用
@article{arxiv.2604.05229,
title = {From Governance Norms to Enforceable Controls: A Layered Translation Method for Runtime Guardrails in Agentic AI},
author = {Christopher Koch},
journal= {arXiv preprint arXiv:2604.05229},
year = {2026}
}
备注
5 pages, 2 tables