CogniAlign:面向安全与可解释性的人类多智能体道德推理框架
计算机与社会
2026-04-14 v2 计算与语言
摘要
人工智能(AI)与人类价值观的对齐问题,由于道德原则的抽象性且常常存在冲突,以及现有方法的不透明性,仍然面临挑战。本文引入 CogniAlign,一种基于自然道德现实主义的人类多智能体 deliberation 框架,通过将道德推理 grounded于生存性(定义为个体维度和集体维度),并通过结构化的、学科特定的科学家智能体间的 deliberation 来实现。每个智能体代表神经科学、心理学、社会学和进化生物学,提供论点与反驳,由仲裁者综合为透明且经验导向的判断。作为一种概念验证研究,我们在经典和新颖的道德问题上评估 CogniAlign,并通过五部分伦理审计框架以及三个专家的帮助,将其输出与 GPT-4o 进行比较。结果表明,CogniAlign 在超过六十个道德问题上 consistently 超越基线,分析质量平均提升 12.2 分,决策性提升 31.2 分,解释深度提升 15 分。在 Heinz 困境中,CogniAlign 获得总分 79 分,而 GPT-4o 仅为 65.8 分,显示在处理道德推理方面具有决定性优势。通过透明且结构化的推理,CogniAlign 展示了一种可审计的 AI 对齐方法的可行性,尽管仍存在一些挑战。
引用
@article{arxiv.2509.13356,
title = {CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI},
author = {Hasin Jawad Ali and Ilhamul Azam and Ajwad Abrar and Md. Kamrul Hasan and Hasan Mahmud},
journal= {arXiv preprint arXiv:2509.13356},
year = {2026}
}
备注
Under Review