哪位更棒:LLM 对抗 LLM
人工智能
2025-08-08 v1
摘要
对抗性棋类游戏作为战略推理与智能的典型范域,长期以来既是流行的竞技活动,也是评估人工智能 (AI) 系统的基准。建立在此基础上,我们提出了一种基于棋类比赛的对抗性基准框架,用于全面评估大语言模型 (LLM) 的综合性能,弥补主流基于问答 (Q&A) 基准方法的数据依赖局限。我们引入了齐镇 (Qi Town),一个支持5种广泛玩法的专业评估平台,涉及20个由 LLM 驱动的玩家。该平台采用 Elo 评级系统和一种新颖的性能环形图 (Performance Loop Graph, PLG),定量评估 LLM 的技术能力,同时捕捉游戏期间的积极情感分数 (Positive Sentiment Score, PSS),以评估心理适应性。评估以 round-robin 锦标赛形式进行,实现对玩家的系统性比较。实验结果表明,尽管技术差异存在,大多数 LLM 仍对胜负持乐观态度,显示出对高压对抗环境的适应性超过人类。另一方面,PLG 中周期性胜负之间的复杂关系揭示了 LLM 在游戏过程中技能表现的不稳定性,亟需进一步解释与探索。
引用
@article{arxiv.2508.04720,
title = {Who is a Better Player: LLM against LLM},
author = {Yingjie Zhou and Jiezhang Cao and Farong Wen and Li Xu and Yanwei Jiang and Jun Jia and Ronghui Li and Xiaohong Liu and Yu Zhou and Xiongkuo Min and Jie Guo and Zicheng Zhang and Guangtao Zhai},
journal= {arXiv preprint arXiv:2508.04720},
year = {2025}
}