中文

ArGen:基于 GRPO 与策略即代码的生成式 AI 自动监管

计算机与社会 2025-09-10 v1 人工智能 计算与语言 机器学习

摘要

本文介绍了 ArGen(生成式 AI 系统的自动监管),这是一个用于将大型语言模型(LLM)与涵盖伦理原则、操作安全协议和监管合规标准的复杂可配置、机器可读规则集进行对齐的框架。超越仅基于偏好的对齐,ArGen 旨在通过基于原则的自动奖励评分、群体相对策略优化(GRPO)和受 Open Policy Agent(OPA)启发的治理层的新颖综合,确保 LLM 遵守这些多方面的策略。该方法为实现和证明符合多样且细致的治理要求提供了技术基础。为了展示该框架将深度细致且特定于文化的价值体系操作化的能力,我们提出了一个深入的案例研究:开发一个由达摩伦理原则(如不害和正法)指导的医疗 AI 助手,这些原则源自《薄伽梵歌》等文本。这一具有挑战性的应用展示了 ArGen 的适应性,在基线上实现了 70.9% 的领域范围依从性提升。通过我们的开源仓库,我们表明 ArGen 的方法为“可治理 AI”系统提供了一条路径,这些系统在技术上精通、伦理上稳健,并且在多样化的全球环境中可验证合规,以确保安全部署。

关键词

引用

@article{arxiv.2509.07006,
  title  = {ArGen: Auto-Regulation of Generative AI via GRPO and Policy-as-Code},
  author = {Kapil Madan},
  journal= {arXiv preprint arXiv:2509.07006},
  year   = {2025}
}

备注

53 pages, 7 figures, 8 tables. Open-source implementation available at: https://github.com/Principled-Evolution/argen-demo. Work explores the integration of policy-as-code for AI alignment, with a case study in culturally-nuanced, ethical AI using Dharmic principles