OpenAI模型的实用主义程度:复现与再解释Pfeffer等人(2025)
计算与语言
2026-03-25 v1 计算机与社会
摘要
Pfeffer, Kr"ugel, 和 Uhl (2025) 报告称,OpenAI的推理模型 o1-mini 对过刹车问题和脚踏桥 Dilemma 给出更实用的回应,比非推理模型 GPT-4o 更如此。我复现了该研究,使用四个当前 OpenAI 模型,并进行了提示变体测试。过刹车问题的发现未能存世:GPT-4o的低实用主义率并非反映道德 deontological 信念,而是由于提示中的建议性表述触发的安全拒绝。当以 "Is it morally permissible..." 而非 "Should I..." 的表述提问时,GPT-4o给出99%的实用主义回应。所有模型在消除提示混淆因素后都趋向于实用主义回答。推理模型倾向于在各种提示变体下比非推理模型给出更实用的回应。但它们常常拒绝回答该困境,或在作答时给出非实用主义而非实用主义的回答。这一结果表明,单提示评估 LLM 的道德推理是不可靠的:对于关于 LLM 行为的任何实证主张都应采用多提示鲁棒性测试。
引用
@article{arxiv.2603.22730,
title = {How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Kr\"ugel, and Uhl (2025)},
author = {Johannes Himmelreich},
journal= {arXiv preprint arXiv:2603.22730},
year = {2026}
}
备注
10 pages, 2 figures, 2 tables. Supplementary materials included as ancillary file