AlphaLab:基于前沿 LLM 的跨优化领域自主多智能体研究
机器学习
2026-04-13 v1 人工智能
摘要
我们提出 AlphaLab,一个利用前沿 LLM 智能体能力实现自动化在定量、计算密集型领域中完成完整实验周期的框架。仅凭数据集和自然语言目标,AlphaLab 依次经过三个阶段即可无需人工干预:(1)它适应领域并探索数据,撰写分析代码并生成研究报告;(2)构建并对抗性验证其自身的评估框架;(3)通过 Strategist/Worker 循环运行大规模 GPU 实验,将领域知识积累到持久的情景表中,作为一种形式的在线提示优化。所有领域特定行为都被 factored 进入由模型自身生成的适配器中,同一管道能够在不修改的情况下处理定性不同的任务。我们使用两个前沿 LLM(GPT-5.2 和 Claude Opus 4.6)在三个领域评估 AlphaLab:在 CUDA 核优化领域中,它编写的 GPU 核以平均 4.4 倍(最高达 91 倍)的速度超过 torch.compile;在 LLM 预训练领域中,完整系统使用相同模型实现比单次基线低 22% 的验证损失;在交通预测领域中,它通过研究和实现文献中的模型家族,比标准基线高出 23-25%。两个模型在每个领域发现定性不同的解决方案(没有统一优势),表明多模型 campaign 提供了互补的搜索覆盖。我们另外在附录中报告了在金融时间序列预测上的结果,并在 https://brendanhogan.github.io/alphalab-paper/ 发布所有代码。
引用
@article{arxiv.2604.08590,
title = {AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs},
author = {Brendan R. Hogan and Xiwen Chen and James T. Wilson and Kashif Rasul and Adel Boyarsky and Thomas Kamei and Anderson Schneider and Yuriy Nevmyvaka},
journal= {arXiv preprint arXiv:2604.08590},
year = {2026}
}
备注
43 pages, 12 figures