神经架构的智能体自主发现:AIRA-Compose 与 AIRA-Design
摘要
为实现递归式自我改进,我们研究了大语言模型(LLM)智能体自主设计超越标准 Transformer 的基础模型。我们引入了一个双框架方法:用于高层架构搜索的 AIRA-Compose,以及用于底层机制实现的 AIRA-Design。AIRA-Compose 使用 11 个智能体在 24 小时的预算内探索基本的计算原语。智能体评估百万参数级的候选架构,并将顶级设计外推至 3.5 亿、10 亿和 30 亿参数规模。这产生了跨越两个家族的 14 种架构:AIRAformers(基于 Transformer)和 AIRAhybrids(Transformer-Mamba 混合)。在 10 亿参数规模预训练后,这些架构一致优于 Llama 3.2 和 Composer-found 基线。在下游任务中,AIRAformer-D 和 AIRAhybrid-D 的准确率分别比 Llama 3.2 提高了 2.4% 和 3.8%。此外,AIRA-Compose 发现了具有高效扩展前沿的模型:AIRAformer-C 的扩展速度比 Llama 3.2 和 Composer 的最佳 Transformer 分别快 54% 和 71%,而 AIRAhybrid-C 的扩展速度比 Nemotron-2 和 Composer 的最佳混合模型分别快 23% 和 37%。AIRA-Design 则分配 20 个智能体来编写用于长程依赖的新型注意力机制和高性能训练脚本。在 Long Range Arena 基准测试中,智能体设计的架构在文档匹配和文本分类任务上分别达到人类最先进水平的 2.3% 和 2.6% 以内。在 Autoresearch 基准测试中,Greedy Opus 4.5 在固定时间预算下实现了 0.968 的验证集每字节比特数,超越了已发布的最低值。总之,这些框架表明 AI 智能体能够自主发现匹配或超越手工设计基线的架构和算法优化。这为发现下一代基础模型建立了一个强大的范式,标志着向递归自我改进迈出了明确的一步。
引用
@article{arxiv.2605.15871,
title = {Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design},
author = {Alberto Pepe and Chien-Yu Lin and Despoina Magka and Bilge Acun and Yannan Nellie Wu and Anton Protopopov and Carole-Jean Wu and Yoram Bachrach},
journal= {arXiv preprint arXiv:2605.15871},
year = {2026}
}
备注
55 pages, 28 figures, 21 tables