PRISM:面向 AI 对齐的集成合成与调解的多视角框架
摘要
本 work 提出了集成合成与调解的视角推理(PRISM),用于解决 AI 对齐中持续存在的挑战,如冲突的人类价值观和规格游戏。PRISM 基于认知科学和道德心理学, 将道德关切组织分为七种“基础世界观”,每个世界观假定捕捉人类道德认知的不同维度,从生存导向的本能反应到更高阶的整合性视角。然后应用一种受 Pareto 启发的优化方案,在不将其降低为单一指标的情况下调和竞争优先事项。在可靠上下文验证可靠使用的假设下,该框架遵循结构化工作流程:征集特定视角的响应,将其综合为平衡结果,并在透明和迭代 manner 中调解剩余冲突。通过引用认知科学、道德心理学和神经科学中对道德认知层次方法,PRISM 澄清了不同道德驱动如何相互作用,并系统性地记录和调解伦理权衡。我们通过一个工作原型生成的实际输出来说明其效能,将 PRISM 应用于公共卫生政策、职场自动化和教育等领域的经典对齐问题。通过将 AI deliberation 锚定在这些人类视角中,PRISM 旨在限制可能导致偏离人类或机器中心领域的解释性跳跃。我们简要概述了未来方向,包括实际部署和形式验证,同时保持对多视角综合和冲突调解的核心关注。
引用
@article{arxiv.2503.04740,
title = {PRISM: Perspective Reasoning for Integrated Synthesis and Mediation as a Multi-Perspective Framework for AI Alignment},
author = {Anthony Diamond},
journal= {arXiv preprint arXiv:2503.04740},
year = {2025}
}
备注
104 pages, 5 figures. Preprint on AI alignment presenting PRISM: a multi-perspective framework that organizes moral concerns into seven basis worldviews and uses Pareto-inspired synthesis to reconcile conflicting human values and specification gaming. Grounded in cognitive science and moral psychology