中文

五种大型语言模型中的合作与背叛策略

计算机与社会 2026-01-16 v1

摘要

大型语言模型(LLMs)越来越多地被部署以支持人类决策。这种对 LLMs 的使用具有令人担忧的影响,尤其是当它们的建议影响到他人的福祉时。为了衡量 LLMs 如何做出社会决策,我们探索了五种领先模型在重复囚徒困境中是否会产生合理的策略,该困境是互惠合作的主要隐喻。首先,我们在一个中性设置中测量了 LLMs 的合作倾向,不使用任何让人联想到该游戏通常呈现方式的措辞。我们记录了 LLMs 在多大程度上实现了纳什均衡或其他众所周知的策略类别。此后,我们探索了 LLMs 如何根据参数值的变化调整其策略。我们改变了游戏的继续概率、收益值以及总回合数是否为共同知识。我们还研究了不同框架效应的影响。在每种情况下,我们都测试了 LLMs 的调整是否符合基本直觉、演化博弈论的理论预测以及来自人类参与者的实验证据。虽然所有 LLMs 在许多任务中表现良好,但没有一个模型在所有任务上表现出完全的一致性。我们还进行了推断出的 LLM 策略之间的锦标赛,并研究了 LLMs 在已知或未知最后一轮的十回合游戏中的直接交互。我们的实验揭示了当前 LLMs 如何实例化互惠合作。

关键词

引用

@article{arxiv.2601.09849,
  title  = {Strategies of cooperation and defection in five large language models},
  author = {Saptarshi Pal and Abhishek Mallela and Christian Hilbe and Lenz Pracher and Chiyu Wei and Feng Fu and Santiago Schnell and Martin A Nowak},
  journal= {arXiv preprint arXiv:2601.09849},
  year   = {2026}
}