中文

COvolve:基于两人零和博弈的大语言模型生成策略与环境的对抗性共演

人工智能 2026-03-31 v1

摘要

构建持续改进的智能体的一个核心挑战是,训练环境通常是静态的或由人工构建的。这限制了在训练分布之外的持续学习和泛化。我们通过 COvolve 来解决这一问题,这是一个利用大语言模型(LLMs)生成环境和代理策略的共演框架,策略以可执行的 Python 代码表达。我们将环境和策略设计者的交互建模为两人零和博弈,确保以对抗性方式进行共演,使得环境暴露策略弱点,策略随之调整。这一过程诱导一种自动化的课程,其中环境和策略共同演进以日益复杂化。为保证在课程推进期间的鲁棒性并防止遗忘,我们计算该零和博弈的混合策略纳什均衡(MSNE),从而产生一个 meta 策略。该 MSNE meta 策略确保代理不会忘记解决以前看到的环境,同时学习解决以前未见过的环境。城市驾驶、符号迷宫解决和几何导航中的实验表明,COvolve 产生了越来越复杂的环境。我们的结果表明,LLM 驱动的共演有望在没有预定义任务分布或人工干预的情况下实现开放式学习。

关键词

引用

@article{arxiv.2603.28386,
  title  = {COvolve: Adversarial Co-Evolution of Large-Language-Model-Generated Policies and Environments via Two-Player Zero-Sum Game},
  author = {Alkis Sygkounas and Rishi Hazra and Andreas Persson and Pedro Zuidberg Dos Martires and Amy Loutfi},
  journal= {arXiv preprint arXiv:2603.28386},
  year   = {2026}
}

备注

Accepted at GECCO 2026