中文

博弈论视角下人类与语言模型的协作与冲突

人工智能 2025-09-08 v1

摘要

语言模型正越来越多地部署于交互式在线环境中,从个人聊天助手到特定领域的智能体,这引发了关于它们在多方环境中合作与竞争行为的问题。尽管先前的工作已在孤立的或短期的博弈论背景下考察了语言模型的决策,但这些研究往往忽略了长程交互、人机协作以及行为模式随时间的演化。在本文中,我们研究了语言模型在迭代囚徒困境(IPD)中的行为动力学,IPD是研究合作与冲突的经典框架。我们将基于模型的智能体与一套包含240种经典策略的集合在阿克塞尔罗德风格的锦标赛中进行对抗,发现语言模型取得了与最知名的经典策略相当,甚至在某些情况下超越它们的性能。行为分析揭示,语言模型展现出与强合作策略相关的关键属性——友善性、可激怒性和宽容性,同时表现出对局中对手策略变化的快速适应能力。在受控的“策略切换”实验中,语言模型仅在几轮内就检测到并响应了变化,其适应性可与人类媲美甚至超越人类。这些结果首次系统性地刻画了语言模型智能体的长期合作行为,为未来研究它们在更复杂的混合人机社会环境中的角色奠定了基础。

关键词

引用

@article{arxiv.2509.04847,
  title  = {Collaboration and Conflict between Humans and Language Models through the Lens of Game Theory},
  author = {Mukul Singh and Arjun Radhakrishna and Sumit Gulwani},
  journal= {arXiv preprint arXiv:2509.04847},
  year   = {2025}
}

备注

9 pages