中文

被推理所腐蚀:推理语言模型在公共物品游戏中成为自由骑手

人工智能 2025-07-25 v2 计算与语言

摘要

随着大语言模型(LLM)越来越多地被用作自主代理,理解它们的合作与社会机制变得越来越重要。特别是,LLM如何在自身利益与集体福祉之间取得平衡,是确保对齐、稳健性和安全部署的关键挑战。本文 examines 代价制裁在多智能体LLM系统中的挑战,智能体必须决定是否投入自身资源来激励合作或惩罚违背。为研究此问题,我们采用了来自行为经济学的具有制度选择的公共物品游戏,使我们能够观察不同LLM如何在反复互动中 navigate 社会困境。我们的分析揭示了模型中四种不同的行为模式:一些模型始终建立并维持高水平的合作,另一些模型在参与和疏离之间波动,一些模型随时间逐渐减少合作行为,另一些模型则固守固定策略,无论结果如何。令人惊讶的是,我们发现推理LLM,如o1系列,在合作方面表现严重不佳,而一些传统LLM则始终实现高水平的合作。这些发现表明,当前聚焦于增强LLM推理能力的方法并不一定导致合作,为在需要持久合作的环境中部署LLM代理提供了宝贵的见解。我们的代码可在https://github.com/davidguzmanp/SanctSim获取。

关键词

引用

@article{arxiv.2506.23276,
  title  = {Corrupted by Reasoning: Reasoning Language Models Become Free-Riders in Public Goods Games},
  author = {David Guzman Piedrahita and Yongjin Yang and Mrinmaya Sachan and Giorgia Ramponi and Bernhard Schölkopf and Zhijing Jin},
  journal= {arXiv preprint arXiv:2506.23276},
  year   = {2025}
}

备注

Published at COLM 2025