中文

DipLLM:微调大语言模型用于外交战略决策

人工智能 2025-06-24 v2 机器学习

摘要

外交是一门复杂的多人博弈,需要合作与竞争,对 AI 系统提出了重大挑战。传统方法依赖均衡搜索来生成大量训练数据,这需要大量计算资源。大语言模型(LLM)提供了一个有前景的替代方案,利用预训练知识以相对小规模的微调实现强劲性能。然而,将 LLM 应用于外交仍具有挑战性,因为可能的动作组合呈指数增长,且玩家之间的战略交互复杂。为应对这一挑战,我们提出 DipLLM,一个经过微调的大语言模型智能体,用于学习外交的均衡策略。DipLLM 采用自回归因子化框架,将复杂的多单元动作分配任务简化为一系列单元级决策。通过在此框架中定义均衡策略作为学习目标,我们仅使用最先进的 Cicero 模型所需数据的 1.5% 进行微调,并超越了其性能。我们的结果展示了经过微调的大语言模型在应对多人博弈中复杂战略决策方面的潜力。

关键词

引用

@article{arxiv.2506.09655,
  title  = {DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy},
  author = {Kaixuan Xu and Jiajun Chai and Sicheng Li and Yuqian Fu and Yuanheng Zhu and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2506.09655},
  year   = {2025}
}

备注

Accepted to the 42nd International Conference on Machine Learning (ICML 2025)