中文

Alignment Flywheel:面向架构无关性安全的治理导向混合多主体系统

多智能体系统 2026-04-30 v2 机器学习 机器人学

摘要

多主体系统提供了角色分解、协调和规范性治理成熟的方法,这些能力随着越来越多的自主决策组件嵌入agent-based系统而日益重要。虽然学习型和生成模型大幅扩展了系统能力,但其安全行为往往与训练过程紧密 entangled,导致不够透明、难以审计,且部署后更新成本高昂。本文形式化提出Alignment Flywheel作为治理导向的混合多主体系统架构,将决策生成与安全治理解耦。代表任意自主决策组件的提议者(Proposer)生成候选轨迹,而安全准Oracle返回通过稳定接口的原始安全信号。执行层在运行时应用明确的风险策略,治理多主体系统对Oracle进行监督,包括审计、不确定性驱动的验证和版本化 refinement。核心工程原则是局部修补:许多新观察到的安全失败可通过更新受管控的Oracle制品及其发布管道而缓解,而无需收回或重新训练底层决策组件。该架构对Proposer和Safety Oracle均具有实现无关性,指定了运行时门控、审计输入、签名修补和分布式部署分阶段推送所需的角色、制品、协议和发布语义。最终形成一个集成高度能力但可能出错的自主系统于明确、受版本控制和可审计监督下的混合多主体系统工程框架。

关键词

引用

@article{arxiv.2603.02259,
  title  = {The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety},
  author = {Elias Malomgré and Pieter Simoens},
  journal= {arXiv preprint arXiv:2603.02259},
  year   = {2026}
}

备注

Accepted for the EMAS workshop at AAMAS 2026