中文

民主化外交:一种评估任意大语言模型在完整强权外交中的评测工具

人工智能 2025-08-12 v1 计算与语言 计算机与社会 机器学习

摘要

我们提出了首个评测工具,使任何开箱即用的本地大语言模型(LLMs)无需微调或专门训练即可进行完整强权外交游戏。以往工作由于外交游戏状态的高复杂性和信息密度,需要前沿LLMs或微调。加之对局的高方差,这些因素使得外交游戏难以用于研究。在本工作中,我们使用数据驱动的迭代优化文本游戏状态表示,使得一个24B模型无需任何微调即可可靠地完成对局。我们开发了工具以促进假设检验和统计分析,并展示了关于说服、激进游戏风格以及跨一系列模型性能的案例研究。我们在众多流行LLMs上进行了多种实验,发现较大的模型表现最佳,但较小的模型也能胜任游戏。我们还引入了关键状态分析:一种用于快速迭代并深入分析游戏中关键时刻的实验协议。我们的工具通过消除微调需求,民主化了对LLMs战略推理能力的评估,并提供了关于这些能力如何从广泛使用的LLMs中自然涌现的见解。我们的代码在补充材料中提供,并将开源。

引用

@article{arxiv.2508.07485,
  title  = {Democratizing Diplomacy: A Harness for Evaluating Any Large Language Model on Full-Press Diplomacy},
  author = {Alexander Duffy and Samuel J Paech and Ishana Shastri and Elizabeth Karpinski and Baptiste Alloui-Cros and Tyler Marques and Matthew Lyle Olson},
  journal= {arXiv preprint arXiv:2508.07485},
  year   = {2025}
}