AutoResearch-RL:面向自主神经网络架构发现的自我评估强化学习代理
机器学习
2026-03-20 v2
摘要
我们提出AutoResearch-RL框架,使强化学习代理能够在无人监督下开展神经网络架构与超参数研究,持续运行直至终止预测者信号指示收敛或资源耗尽。在每一步,代理提出训练脚本的代码修改,在固定计时预算下执行,观察由验证位每字节(val-bpb)派生的标量奖励,并通过近端策略优化(PPO)更新其策略。关键设计洞察在于分离三个关注点:(i)冻结环境(数据管道、评估协议、常数)保证公平跨实验比较;(ii)可变目标文件(train.py)表示代理的可编辑状态;(iii)元学习者(RL代理本身)累积不断增长的实验结果轨迹,并据此指导后续提案。我们将其形式化为马尔可夫决策过程,推导在温和假设下的收敛保证,并在单GPU纳米聊天预训练基准上实证表明,AutoResearch-RL在约300个夜间迭代后发现的配置可匹配或超越手工调优基准,无需人类参与。
引用
@article{arxiv.2603.07300,
title = {AutoResearch-RL: Perpetual Self-Evaluating Reinforcement Learning Agents for Autonomous Neural Architecture Discovery},
author = {Nilesh Jain and Rohit Yadav and Sagar Kotian and Claude AI},
journal= {arXiv preprint arXiv:2603.07300},
year = {2026}
}
备注
arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions