中文

CONSCIENTIA:大语言模型代理能否学习战略决策?多智能体纽约城市模拟中的战略行为与信任崩溃

多智能体系统 2026-04-14 v1 人工智能 计算与语言

摘要

随着大语言模型(LLM)日益被部署为自主代理,理解多智能体环境中战略行为的涌现已成为重要的对齐挑战。我们采取中性经验立场,构建一个受控环境,以便直接观察和测量战略行为。我们引入一个大规模多智能体模拟,模拟简化后的纽约城市,LLM驱动的代理在相互冲突的激励下进行交互。蓝色代理旨在高效到达目的地,而红色代理则试图通过富有说服力的语言将其引导至包含广告牌的路线,以最大化广告收益。隐藏身份使导航变得社会化,迫使代理在何时信任或欺骗之间做出决定。我们通过迭代模拟管道研究策略学习,该管道使用卡恩-伏尔斯基优化(Kahneman-Tversky Optimization, KTO)在重复交互轮次中更新代理策略。蓝色代理优化以减少广告牌暴露,同时保持导航效率,而红色代理则适应以利用剩余漏洞。随着迭代进行,最佳蓝色策略将任务成功率从46.0%提升至57.3%,尽管仍高达70.7%的脆弱性。后期策略显示出更强的选择性合作,同时保持轨迹效率。然而,仍存持久的安全-有帮助性权衡:更能抵抗对抗性引导的策略并不一定同时最大化任务完成。总体而言,我们的结果表明,LLM代理可以表现出有限的战略行为,包括选择性信任与欺骗,同时高度易受对抗性说服攻击。

关键词

引用

@article{arxiv.2604.09746,
  title  = {CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation},
  author = {Aarush Sinha and Arion Das and Soumyadeep Nag and Charan Karnati and Shravani Nag and Chandra Vadhan Raj and Aman Chadha and Vinija Jain and Suranjana Trivedy and Amitava Das},
  journal= {arXiv preprint arXiv:2604.09746},
  year   = {2026}
}