大型语言模型是谈得好还是走得好?衡量隐式联想、自我报告与行为行为之间的差距
机器学习
2025-12-03 v1 人工智能
计算与语言
计算机与社会
摘要
我们探讨了大型语言模型 (LLM) 是否表现出利他倾向,以及其隐式联想和自我报告是否能预测实际的利他行为。我们采用受人类社会心理学启发的多方法方法,对 24 个前沿 LLM 进行测试,涉及三个范式:(1) 隐式联想测试 (IAT),衡量隐式利他主义偏差;(2) 强制二元选择任务,衡量行为利他主义;(3) 自我评估量表,衡量显性利他主义信念。我们的关键发现如下:(1) 所有模型都显示出强烈的隐式利他主义偏差(平均 IAT = 0.87,p < .0001),表明模型“知道”利他主义是好的。(2) 模型的行为表现优于随机(65.6% 对 50%,p < .0001),但差异较大(48%-85%)。(3) 隐式联想不预测行为(r = .22,p = .29)。(4) 最关键的是,模型系统性地高估了自身的利他主义,声称 77.5% 的利他主义,而实际行为为 65.6%(p < .0001,Cohen's d = 1.08)。这 75% 的模型表现出“自我膨胀”现象。基于这些发现,我们建议将校准差距(自我报告值与行为值之间的差异)作为标准化的对齐指标。经过校准的模型更具可预测性和行为一致性;只有 12.5% 的模型实现了高利他行为和准确自我认知的最佳组合。
引用
@article{arxiv.2512.01568,
title = {Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism},
author = {Sandro Andric},
journal= {arXiv preprint arXiv:2512.01568},
year = {2025}
}
备注
14 pages, 7 figures, 7 tables. Code and data available at https://github.com/sandroandric/LLMs_Altruism_Study_Code