中文

NNGPT:重新思考基于大语言模型的AutoML

人工智能 2025-11-26 v1 机器学习 神经与进化计算

摘要

构建自改进AI系统是AI领域的根本性挑战。我们提出NNGPT,一个开源框架,将大语言模型(LLM)转化为用于神经网络开发的自改进AutoML引擎,主要针对计算机视觉。不同于以往框架,NNGPT通过生成新模型扩展神经网络的数据集,使LLM能够在基于生成、评估和自我改进的闭环系统中进行持续微调。它集成了五个互补的LLM管线:零样本架构合成、超参数优化(HPO)、代码感知的准确率/提前停止预测、检索增强的范围封闭的PyTorch块合成(NN-RAG)以及强化学习。基于LEMUR数据集构建,作为一个经过审计的、具有可重复指标的语料库,NNGPT从单个提示中发出并验证网络架构、预处理代码和超参数,端到端执行并从结果中学习。PyTorch适配器使NNGPT框架无关,实现了强大的性能:NN-RAG在1289个目标上实现73%的可执行性,3-shot提示提升了常见数据集上的准确率,基于哈希的去重节省了数百次运行。一键预测匹配基于搜索的AutoML,减少了大量试验的需求。在LEMUR上的HPO实现RMSE 0.60,优于Optuna(0.64),而代码感知预测器实现RMSE 0.14,Pearson r=0.78。该系统已经生成了超过5000个验证通过的模型,证明NNGPT是一个自主AutoML引擎。届时将公开代码、提示和检查点,以便社区获取可重复性和便于社区使用。

关键词

引用

@article{arxiv.2511.20333,
  title  = {NNGPT: Rethinking AutoML with Large Language Models},
  author = {Roman Kochnev and Waleed Khalid and Tolgay Atinc Uzun and Xi Zhang and Yashkumar Sanjaybhai Dhameliya and Furui Qin and Chandini Vysyaraju and Raghuvir Duvvuri and Avi Goyal and Dmitry Ignatov and Radu Timofte},
  journal= {arXiv preprint arXiv:2511.20333},
  year   = {2025}
}