中文

比人类更友善:大语言模型在囚徒困境中如何表现?

计算机与社会 2024-09-20 v2 人工智能 计算机科学与博弈论 物理与社会

摘要

大语言模型(LLM)作为人工社会智能体的行为在很大程度上尚未被探索,我们仍然缺乏这些智能体如何对简单社会刺激做出反应的广泛证据。在经典博弈论实验中测试 AI 智能体的行为,为评估这些智能体在典型社会情境中的规范和价值观提供了一个有前景的理论框架。在这项工作中,我们研究了三个 LLM(Llama2、Llama3 和 GPT3.5)在与表现出不同敌意水平的随机对手进行重复囚徒困境博弈时的合作行为。我们引入了一种系统性的方法来评估 LLM 对游戏规则的理解能力以及解析历史游戏日志以进行决策的能力。我们模拟了持续 100 轮的博弈,并按照行为经济学文献中定义的维度分析了 LLM 的决策。我们发现,所有模型都倾向于不首先背叛,而是谨慎行事,仅在对手背叛率较低时才更倾向于合作而非背叛。总体而言,LLM 的行为至少与典型的人类玩家一样具有合作性,尽管我们的结果表明模型之间存在一些显著差异。特别是,Llama2 和 GPT3.5 比人类更合作,并且当对手背叛率低于 30% 时尤其宽容且不报复。与人类更相似的是,Llama3 表现出持续的不合作和剥削性行为,除非对手始终合作。我们对 LLM 在博弈论场景中的系统性研究,是朝着利用这些模拟来指导 LLM 审计和对齐实践迈出的一步。

关键词

引用

@article{arxiv.2406.13605,
  title  = {Nicer Than Humans: How do Large Language Models Behave in the Prisoner's Dilemma?},
  author = {Nicoló Fontana and Francesco Pierri and Luca Maria Aiello},
  journal= {arXiv preprint arXiv:2406.13605},
  year   = {2024}
}

备注

v1: 9 pages, 8 figures, 1 table v2: 11 pages, 14 figures, 1 table. Increased number of models studied, expanded results and conclusion, added references, corrected typos