人类、AI 系统与其设计者对齐目标问题:道德判断的差异性分析
计算机与社会
2026-05-13 v2 人工智能
人机交互
摘要
将机器行为与人类价值观对齐提出了一个基本问题:道德期待应由谁来指导 AI 的决策?大量对齐研究假设合适的基准是人类在给定情境下会如何行动。代理类型价值分叉的研究表明,人们并不总是以相同方式评价人类与 AI 系统。本文通过检验两种进一步可能性来扩展这一挑战:第一,揭示 AI 行为的评估会因其人类来源被显现而改变;第二,人们对为 AI 系统编写程序的程序员的评价不同于对机器或其所对比的人类行动者。我们通过对 1,002 名美国成年人的实验,测量在越野矿车情境中对道德判断的变化,具体变量为评价对象跨四种情况:维修员、维修机器人、由公司工程师编程的维修机器人以及公司工程师为维修机器人编程。我们发现,对维修员和机器人的评价无显著差异。然而,当机器人的行为被描述为人类设计的产物时,判断结果发生了显著变化。参与者在评估所谓的编程机器人或由其编程的工程师时,表现出显著更为deontological(deontological)、基于规则的推理,这表明将人类行为显现出来会激活更高的道德约束。这些发现表明,人们可能以不同方式评价人类、在相同情境下行动的 AI 系统以及设计它们的人。由于这些评价并不一定收敛,这就产生了对齐目标问题:在高风险领域中,人工道德代理应以何种规范性目标为导向,以及这些多元判断能否在一致的价值对齐论述中得到调和。
引用
@article{arxiv.2604.24155,
title = {The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers},
author = {Benjamin Minhao Chen and Xinyu Xie},
journal= {arXiv preprint arXiv:2604.24155},
year = {2026}
}
备注
Accepted at ACM FAccT 2026