通过博弈论理解大语言模型智能体行为:策略识别、偏差与多智能体动力学
多智能体系统
2025-12-15 v2 人工智能
计算机科学与博弈论
机器学习
动力系统
摘要
随着大语言模型(LLMs)越来越多地在交互式和多智能体系统以及人类社会中作为自主决策者运作,理解其战略行为对安全性、协调性以及 AI 驱动的社会和经济基础设施的设计具有深远影响。评估此类行为需要能够捕捉 LLMs 输出及其决策背后潜在意图的方法。在本工作中,我们将 FAIRGAME 框架扩展为通过两项互补性进展系统地评估 LLM 在重复社会困境中的行为:一个隔离了对激励幅度敏感性的收益缩放囚徒困境,以及一个具有动态收益和多智能体历史的集成多智能体公共物品博弈。这些环境揭示了跨模型和语言的稳定行为特征,包括对激励敏感的合作、跨语言分歧以及向背叛的终局对齐。为解释这些模式,我们训练了传统监督分类模型来识别经典重复博弈策略,并将其应用于 FAIRGAME 轨迹,结果表明 LLMs 表现出系统性的、依赖于模型和语言的行为意图,语言框架有时产生的影响与架构差异一样强。这些发现共同为将 LLMs 审计为战略智能体提供了统一的方法论基础,并揭示了具有直接 AI 治理、集体决策和安全多智能体系统设计含义的系统性合作偏差。
引用
@article{arxiv.2512.07462,
title = {Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics},
author = {Trung-Kiet Huynh and Duy-Minh Dao-Sy and Thanh-Bang Cao and Phong-Hao Le and Hong-Dan Nguyen and Phu-Quy Nguyen-Lam and Minh-Luan Nguyen-Vo and Hong-Phat Pham and Phu-Hoa Pham and Thien-Kim Than and Chi-Nguyen Tran and Huy Tran and Gia-Thoai Tran-Le and Alessio Buscemi and Le Hong Trang and The Anh Han},
journal= {arXiv preprint arXiv:2512.07462},
year = {2025}
}