中文

面向序列决策智能体的分层道德对齐评估基准

人工智能 2026-05-22 v2 机器学习

摘要

评估在存在冲突、分层结构人类规范的情境下,智能体道德对齐程度,是 AI 安全、道德哲学与认知科学交叉领域的关键挑战。我们提出了“道德链”(Morality Chains)的新型形式化方法,将道德规范表示为有序的 deontic 约束,并提出了名为 MoralityGym 的评估基准,包含 98 个以电车难题式环境呈现的伦理困境问题。通过将任务解决与道德评估解耦,并引入新颖的道德指标(Morality Metric),MoralityGym 允许将心理学和哲学的见解整合到规范敏感推理的评估中。基于安全强化学习方法的基准结果揭示了关键局限性,凸显了需要更原则性方法来实现伦理决策的必要性。这项工作为开发在复杂真实情境下行为更可靠、更透明且更伦理的 AI 系统提供了基础。

关键词

引用

@article{arxiv.2602.13372,
  title  = {MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents},
  author = {Simon Rosen and Siddarth Singh and Ebenezer Gelo and Helen Sarah Robertson and Ibrahim Suder and Victoria Williams and Benjamin Rosman and Geraud Nangue Tasse and Steven James},
  journal= {arXiv preprint arXiv:2602.13372},
  year   = {2026}
}

备注

Accepted at AAMAS 2026