中文

通过自我对弈增强语言智能体在对抗性游戏中的战略推理

计算与语言 2025-10-21 v1

摘要

现有的语言智能体在动态对抗性游戏中常因战略推理能力不足而面临挑战。为缓解这一限制,一种可行的方法是允许智能体通过自动学习游戏交互而无需依赖昂贵的专家标注数据。在静态环境中,智能体接收固定的反馈或奖励;而在动态对抗性游戏中,选择合适的对手对学习性能影响巨大。然而,对抗环境中的对手选择讨论仍处于探索阶段。本文提出了一种基于博弈中学习的步骤级策略优化方法——SCO-PAL。利用SCO-PAL,我们通过设置不同水平的对手,对对手选择进行了深入分析,发现自我对弈是改善此类对抗环境战略推理最有效的方式。采用SCO-PAL的自我对弈,我们将在四个对手中的平均胜率提升约30%,并在六个对抗性游戏中以54.76%的胜率击败GPT-4。

关键词

引用

@article{arxiv.2510.16761,
  title  = {Enhancing Language Agent Strategic Reasoning through Self-Play in Adversarial Games},
  author = {Yikai Zhang and Ye Rong and Siyu Yuan and Jiangjie Chen and Jian Xie and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2510.16761},
  year   = {2025}
}