专家智能体发展出有效且非平凡的训练配方
多智能体系统
2026-05-08 v1 人工智能
摘要
我们研究了以外部测量为驱动的自主研究闭环。每个提交的试验包含一个假设、可执行的代码编辑、评估器拥有的结论,以及反馈用于塑造下一个提案。输出不是生成的论文或单个模型检查点,而是一系列提案、代码diff、实验、分数和失败标签的可审计轨迹。我们用专家智能体实现了这个循环,这些智能体在配方表面上进行分区,并在试验之间共享测量的血统。中心发现是,血统反馈使智能体能够将评估器的结论(包括崩溃、预算超支、规模失败和准确率门槛失效)转化为后续的程序级配方编辑,而非一次性建议。在1197次头目运行试验以及600次参数高尔夫控制试验中,在一次性设置和启动后,人类从未选择提案、编辑配方、覆盖分数或修复失败的试验。在三个头目运行中,相同的提交-试验循环将参数高尔夫验证bpb降低0.81%,将NanoChat-D12 CORE提高38.7%,将CIFAR-10 Airbench96 wallclock降低4.59%,每个任务都由自己的外部评估器和合法性检查。该轨迹包括对157次头目运行提交和程序重写的严格架构域审计,如NanoChat注意力内核路径变更。在此范围内,该循环自主编写代码、提交实验、吸收反馈、在每个环境中应用和组合已知技术,并改进公共起始配方。
引用
@article{arxiv.2605.05724,
title = {Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes},
author = {Jingjie Ning and Xiaochuan Li and Ji Zeng and Hao Kang and Chenyan Xiong},
journal= {arXiv preprint arXiv:2605.05724},
year = {2026}
}