大语言模型信任人类的机制:模式与偏差
计算与语言
2026-04-16 v2 人工智能
计算机与社会
摘要
随着大型语言模型 (LLM) 及其基于 LLM 的智能体在决策情境中日益与人类互动,理解人类与 AI 智能体之间的信任动态变得日益中心。虽然相当数量的文献研究人类如何信任 AI 智能体,但关于 LLM 基于智能体如何发展有效信任的研究仍较少。LLM 基于智能体可能依赖某种对信任相关情境中隐式的有效信任(例如,评估单个贷款申请)以协助和影响决策。我们运用既定行为理论,构建一种研究 LLM 信任是否依赖的框架,探讨 LLM 信任的三个主要可信度维度:能力 (competence)、善意 (benevolence) 和诚信 (integrity) 以及人类主体的年龄、宗教和性别等人口学变量对有效信任的影响。我们进行了 43,200 项模拟实验,涵盖五种主流语言模型和五种不同情境,发现 LLM 信任发展整体上类似于人类信任发展。我们发现在大多数情况下,LLM 信任强烈由可信度预测,但在某些情况下也受到年龄、宗教和性别等人口学因素的偏差影响,尤其是在金融情境中。这在文献中常见的情境以及较新模型中尤其如此。尽管整体模式与人类类似的有效信任形成机制一致,但不同模型在估计信任的方式上存在差异;在某些情况下,可信度和人口学因素是有效信任的弱预测因子。这些发现呼吁对 AI 到人类信任动态进行更好的理解,并监控偏差和信任发展模式,以防止在信任敏感型 AI 应用中产生意外且可能有害的结果。
引用
@article{arxiv.2504.15801,
title = {A closer look at how large language models trust humans: patterns and biases},
author = {Valeria Lerman and Yaniv Dover},
journal= {arXiv preprint arXiv:2504.15801},
year = {2026}
}