中文

策略化提示:将 AI 监管规则转化为 AI 智能体的防护栏

计算与语言 2025-11-10 v2 人工智能

摘要

在受监管且安全关键环境中应用自主 AI 智能体时,组织需要有效的方式将政策转化为可执行的控制措施。我们引入了一个监管机器学习框架,将非结构化的设计制品(如 PRD、TDD 和代码)转化为可验证的运行时防护栏。我们的策略化提示方法读取这些文档和风险控制,以构建一个源链接的政策树。该树随后被编译为轻量级的基于提示的分类器,用于实时运行时监控。该系统旨在执行最小权限和数据最小化。对于合规性评估,它提供完整的前身、可追溯性和审计日志记录,所有这些都集成了人机协同审查流程。评估表明,我们的系统降低了提示注入风险,阻止了超出范围的请求,并限制了有毒输出。它还生成与 AI 监管框架一致的可审计理由。通过将政策视为可执行提示(一种面向智能体的政策即代码),该方法实现了以安全为设计、持续合规以及可规模化的 AI 安全和 AI 安全保证。

关键词

引用

@article{arxiv.2509.23994,
  title  = {Policy-as-Prompt: Turning AI Governance Rules into Guardrails for AI Agents},
  author = {Gauri Kholkar and Ratinder Ahuja},
  journal= {arXiv preprint arXiv:2509.23994},
  year   = {2025}
}

备注

Accepted at 3rd Regulatable ML Workshop at NEURIPS 2025