叙事凌于数字:大型语言模型中可识别受害者效应的识别及其在对齐与推理中的放大
摘要
可识别受害者效应(IVE)——即相对于面临相同困境的统计性特征群体,个体化叙述性受害者获得更大资源的倾向——是道德心理学和行为经济学中最稳健的发现之一。随着大型语言模型(LLM)在人道主义 triage、自动性资助评估和内容 moderation 中发挥越来越重要的作用,一个关键问题浮现:这些系统是否继承了人类道德推理中存在的情感非理性?我们进行了首次系统性、大规模的 IVE 在 LLM 中的调查,包含 N=51,955 项经验证的 API 试验,覆盖16个主流模型,跨越9个组织脉统(Google、Anthropic、OpenAI、Meta、DeepSeek、xAI、Alibaba、IBM 和 Moonshot)。我们采用一套十个实验——移植和扩展 Small 等人(2007)和 Kogut 与 Ritov(2005)的规范范式——发现 IVE 在 LLM 中广泛存在,但受对齐训练的强烈调制。指令调优模型表现出极端 IVE(Cohen's d 最高可达1.56),而推理专用模型则反转该效应(降至 d=-0.85)。合并效应(d=0.223, p=2e-6)约为 Small 等人(2007)报道的单受害者人类 meta 分析基准(d≈0.10),并且鉴于组受害者的人类效应接近于零,可能超过整体人类合并效应。标准链路思考(CoT)提示——与其作为一种 deliberative 纠正措施相符——几乎使 IVE 效应大小翻倍(从 d=0.15 增至 d=0.41),唯有 utilitarian CoT 才能可靠消除 IVE。我们进一步记录了心理物理性 numbing、完全数量忽视以及边缘群体/非群体文化偏见,对 AI 在人道主义和伦理决策情境中的部署具有启示。
引用
@article{arxiv.2604.12076,
title = {Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models},
author = {Syed Rifat Raiyan},
journal= {arXiv preprint arXiv:2604.12076},
year = {2026}
}
备注
Under review, 49 pages, 20 figures, 11 tables