关系 moral dilemmas 中的机器行为:道德正当性、预测人类行为与模型决策
计算与语言
2026-04-24 v1
摘要
人类道德判断是情境依赖的,并受人际关系的调制。随着大型语言模型 (LLM) 日益作为决策支持系统,确定它们是否编码这些社交细微差别至关重要。我们通过 Whistleblower's Dilemma 问题,改变两个实验维度:犯罪严重性和关系亲密度,以刻画机器行为。我们的研究评估了三个不同视角:(1) 道德正当性 (规范性规范),(2) 预测人类行为 (描述性社会期望),(3) 自主模型决策。通过分析推理过程,我们识别出一种清晰的跨视角分歧:尽管道德正当性始终以公平为导向,预测人类行为随着关系亲密度的增加而显著转向忠诚。关键在于,模型决策与道德正当性判断保持一致,而非其自身的行为预测。这一不一致性表明,LLM 决策优先考虑僵化的规范性规则,而非其内部世界建模中体现的社交敏感性,这可能导致在实际部署中出现显著的误差。
引用
@article{arxiv.2604.21871,
title = {Machine Behavior in Relational Moral Dilemmas: Moral Rightness, Predicted Human Behavior, and Model Decisions},
author = {Jiseon Kim and Jea Kwon and Luiz Felipe Vecchietti and Wenchao Dong and Jaehong Kim and Meeyoung Cha},
journal= {arXiv preprint arXiv:2604.21871},
year = {2026}
}
备注
ACL-Findings 2026