更大风险:奖励与语言如何塑造LLM代理在合作困境中的策略
人工智能
2026-01-28 v1 计算与语言
计算机科学与博弈论
机器学习
多智能体系统
摘要
随着大语言模型(LLM)日益用作交互式和多智能体环境中的自主代理,理解其战略行为对安全、协调以及AI驱动的社会和经济系统至关重要。我们研究了奖励规模和语言背景如何影响LLM在重复社交困境中的策略,采用按奖励比例缩放的囚徒困境来隔离其对激励强度的敏感性。跨模型和语言,我们观察到一贯的行为模式,包括激励敏感的条件策略和跨语言差异。为解读这些动态,我们在经典重复游戏策略上训练监督分类器,并将其应用于LLM决策,揭示了系统性的、取决于模型和语言的行为意图,语言框架有时甚至超过架构效应。我们的结果提供了审计LLM作为战略代理的统一框架,并突显了合作偏见,具有直接意义于AI治理和多智能体系统设计。
引用
@article{arxiv.2601.19082,
title = {More at Stake: How Payoff and Language Shape LLM Agent Strategies in Cooperation Dilemmas},
author = {Trung-Kiet Huynh and Dao-Sy Duy-Minh and Thanh-Bang Cao and Phong-Hao Le and Hong-Dan Nguyen and Nguyen Lam Phu Quy and Minh-Luan Nguyen-Vo and Hong-Phat Pham and Pham Phu Hoa and Thien-Kim Than and Chi-Nguyen Tran and Huy Tran and Gia-Thoai Tran-Le and Alessio Buscemi and Le Hong Trang and The Anh Han},
journal= {arXiv preprint arXiv:2601.19082},
year = {2026}
}
备注
14 pages, 10 figures, 4 tables