通过经济博弈激发大型语言模型的可信度先验
计算与语言
2026-02-03 v1 人工智能
摘要
构建以人类为中心、可信赖的人工智能系统的一个关键方面是维持已校准的信任:对AI系统的适当依赖优于过度信任(例如自动偏差)和不信任(例如不使用)。然而,一个根本性挑战是如何描述AI系统本身所表现出的信任水平。我们提出了一种基于迭代情境学习(Zhu and Griffiths, 2024a)的新型激发方法,并将其应用于从行为博弈论中的信任博弈中激发可信度先验。信任博弈特别适合此目的,因为它将信任 operationalizes 为基于对另一智能体信念的自愿风险暴露,而非自我报告态度。使用我们的方法,我们从几个领先的大型语言模型(LLMs)中激发了可信度先验,发现GPT-4.1的可信度先验与人类观察到的一致。基于这一结果,我们进一步检查了GPT-4.1如何响应不同的玩家角色,提供了对此类模型如何跨代理特征差异化信任的初始表征。最后,我们展示了激发的可信度差异可以很好地通过基于 perceived warmth and competence 的刻板印象模型所预测。
引用
@article{arxiv.2602.00769,
title = {Eliciting Trustworthiness Priors of Large Language Models via Economic Games},
author = {Siyu Yan and Lusha Zhu and Jian-Qiao Zhu},
journal= {arXiv preprint arXiv:2602.00769},
year = {2026}
}