从记忆到创造:LLM 作为新型神经网络架构设计者
机器学习
2026-04-17 v2 计算机视觉与模式识别
摘要
大语言模型(LLM)在程序综合方面表现卓越,但其在神经网络架构设计——在语法可靠性、性能和结构新颖性之间进行平衡——方面的潜能仍未得到充分探索。我们提出了一个闭环架构合成管道 within the NNGPT 框架,其中,一个注重代码的 LLM 在 22 次受监督微调循环中演化。每个循环中,LLM 合成 PyTorch 卷积网络,通过低保真性能信号进行验证,并通过 MinHash-Jaccard 标准筛选以防止结构冗余后纳入 LEMUR 数据集。表现优异且结构新颖的候选方案被转换为提示-代码对,用于参数高效 LoRA 微调。这个反馈循环推动了可衡量的分布式迁移,逐渐内化经验性架构先验,使得有效且高性能的输出从稀缺转为占主导地位。 在 CIFAR-10 上,有效生成率稳定在 50.6%(峰值 74.5%),首次epoch准确率从 28.1% 提升至 51.0%,超过 40% 准确率的候选方案从 2.0% 增长至 96.8%。跨数据集迁移到 CIFAR-100 和 SVHN 表明,改进的有效性、准确率分布的迁移以及持续的新颖性都能在不同难度和视觉域的基准测试中得到验证。跨越 22 个循环,455 个原文献中不存在的独特架构在新颖性筛选器下被采纳。通过以执行反馈和新颖性过滤为基础,我们展示了迭代自监督微调如何塑造一个任务专用的 LLM 架构先验——提升生成可靠性、代理性能和结构多样性,为无需人工标注的可复制替代方案提供了可能。
引用
@article{arxiv.2601.02997,
title = {From Memorization to Creativity: LLM as a Designer of Novel Neural Architectures},
author = {Waleed Khalid and Dmitry Ignatov and Radu Timofte},
journal= {arXiv preprint arXiv:2601.02997},
year = {2026}
}