通过自我对弈的自我改进 AI 代理
人工智能
2025-12-03 v1 机器学习
摘要
我们将 psychometric battery 的模数理论框架扩展到动力系统领域。虽然先前工作在代理表示空间上建立了 AAI 能力评分作为静态函数,但本文将代理建模为参数为计算资源 的流 ,受递归生成-验证-更新(GVU)算子支配。我们证明了该算子在参数流形 上生成向量场,并在该流中识别了能力函数的导数,即自我改进系数 。本文的核心贡献是导出方差不等式,这一谱条件在轻微正则性条件下足以保证自我改进的稳定性。我们表明, 的充分条件是,在曲率和步长效应之外,生成和验证的组合噪声必须足够小。随后,我们将该形式化方法应用于统一近期关于语言自我对弈(LSP)、自我纠正和合成数据引导的文献。我们展示了诸如 STaR、SPIN、Reflexion、GAN 和 AlphaZero 等架构是 GVU 算子的具体拓扑实现,这些实现通过过滤、对抗判别或建立在形式系统之上满足方差不等式。
引用
@article{arxiv.2512.02731,
title = {Self-Improving AI Agents through Self-Play},
author = {Przemyslaw Chojecki},
journal= {arXiv preprint arXiv:2512.02731},
year = {2025}
}