用 GRACE 打破规范性单一主义代理:面向安全与伦理 AI 对齐的基于理由的神经符号架构
人工智能
2026-02-03 v2 计算机与社会
摘要
随着 AI 代理日益自主、广泛部署于重大情境中并在实现真实世界影响方面高效,确保其决策不仅在工具上有效,也在规范上对齐已变得至关重要。我们引入一种神经符号 reason-based 隔离架构,面向安全与伦理 AI 对齐的理由对齐约束架构 (GRACE),其将规范推理与工具决策分离,可容纳 virtually any 设计的 AI 代理。GRACE 将决策重构为三个模块:道德模块 (MM) 通过基于 deontic logic 的推理确定可接受的宏观行动;决策模块 (DMM) 封装目标代理,同时根据派生的宏观行动选择符合工具最优性的原始行动;以及监护人模块,用于监控和强制执行道德合规性。MM 使用 reason-based 形式主义为 deontic logic 提供语义基础,实现可解释性、可争议性和可辩护性。其符号表示丰富了 DMM 的信息上下文,并支持由监护人执行的对齐形式化验证和统计保证。我们在 LLM 治疗助理的示例中展示了 GRACE,展示了其如何使利益相关者能够理解、争议和细化代理行为。
关键词
引用
@article{arxiv.2601.10520,
title = {Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment},
author = {Felix Jahn and Yannic Muskalla and Lisa Dargasz and Patrick Schramowski and Kevin Baum},
journal= {arXiv preprint arXiv:2601.10520},
year = {2026}
}
备注
10 pages, 4 figures, accepted at 2nd Annual Conference of the International Association for Safe & Ethical AI (IASEAI'26)