用于评估人类和语言模型道德推理的程序化困境生成
计算与语言
2024-04-18 v1
摘要
随着语言模型等AI系统越来越多地整合到影响人们生活的决策过程中,确保这些系统具有健全的道德推理至关重要。为了测试它们是否具备,我们需要开发系统评估。我们提供了一个框架,使用语言模型将捕捉道德困境关键方面的因果图转换为提示模板。利用该框架,我们程序化地生成了大量多样化的道德困境——OffTheRails基准——包含50个场景和400个独特测试项。我们收集了人类参与者对部分项目的道德允许性和意图判断,并将这些判断与两个语言模型(GPT-4和Claude-2)在八种条件下的判断进行比较。我们发现,当伤害是必要手段(相对于副作用)时,参与者和语言模型的允许性评分更低,意图评分更高。对于可避免与不可避免的有害结果也观察到相同模式。然而,伤害是由代理人的行动还是由不作为导致的效果不明确。我们讨论了提示生成管道的局限性以及改进场景以增强实验效果的机会。
关键词
引用
@article{arxiv.2404.10975,
title = {Procedural Dilemma Generation for Evaluating Moral Reasoning in Humans and Language Models},
author = {Jan-Philipp Fränken and Kanishk Gandhi and Tori Qiu and Ayesha Khawaja and Noah D. Goodman and Tobias Gerstenberg},
journal= {arXiv preprint arXiv:2404.10975},
year = {2024}
}
备注
CogSci 2024