RoboPhD:在紧张评估预算下演化多样化复杂智能体
摘要
2026 年标志着 LLM 指导的智能体演化浪潮的爆发,GEPA 和 Autoresearch 等系统表明 LLM 可以在多个领域持续改进提示、代码和智能体架构。随着采用速度的加快,一个核心问题浮现:在相同的预算下,给定相同的信息、相同的种子智能体和相同的目标,哪种优化算法能产生最佳结果?当评估成本高昂(例如需要人类判断或多个 LLM 调用)时,这一问题变得至关重要。我们present了首个系统性比较,评估了三种优化范式——Elo 锦标赛选择(RoboPhD)、Pareto 基于选择(GPEA)和贪心爬坡(Autoresearch)——在四个基准测试上的表现,这些基准测试涵盖抽象推理、云调度、SQL 生成和金融问答,所有测试均在固定 1500 次评估预算下进行。RoboPhD 引入了无验证演化:它不将预算在训练和验证之间分割,而是使用训练数据上的 Elo 竞赛同时评估智能体并驱动演化。所有三种系统接收带有诊断 print() 语句的种子智能体,演化可以增长这些语句,使智能体能够开发出越来越有信息的诊断,以利于其演化后继者。使用单一默认配置,RoboPhD 在三个基准测试中超越 GEPA 和 Autoresearch,仅在最简单的任务上落后——在我们的 Autoresearch 适应方案中获胜的解决方案仅需不到 90 行代码。在 ARC-AGI 上,RoboPhD 将 22 行的种子智能体演化为 1013 行的多策略系统,将准确率从 27.8% 提升到 65.8%,使用 Gemini 3.1 Flash Lite 作为求解器。我们将 RoboPhD 发布为一个通用工具包,采用 MIT 许可证,提供简单的 optimize_anything() API 用于演化多样化复杂智能体。
引用
@article{arxiv.2604.04346,
title = {Topological Phase Transitions and Their Thermodynamic Fate in Arbitrary-$S$ Pyrochlore Spin Ice},
author = {Sena Watanabe and Yukitoshi Motome and Haruki Watanabe},
journal= {arXiv preprint arXiv:2604.04346},
year = {2026}
}
备注
20 + 17 pages, 6 figures, 4 tables