增强基于大语言模型的神经网络生成:面向自动化架构设计的少样本提示与高效验证
计算机视觉与模式识别
2026-04-17 v2 人工智能
摘要
自动化神经网络架构设计仍是计算机视觉领域的一项重大挑战。任务的多样性和计算约束要求既有有效的架构,也需要高效的搜索方法。大语言模型(LLM)为计算密集型的神经架构搜索(NAS)提供了一种有前景的替代方案,但其在计算机视觉架构生成中的应用,尤其是在提示工程和验证策略方面,尚未得到系统研究。基于任务无关的 NNGPT/LEMUR 框架,本工作为计算机视觉引入并验证了两项关键贡献。首先,我们提出了少样本架构提示(FSAP),这是首次对基于 LLM 的架构生成中支持示例数量(n = 1, 2, 3, 4, 5, 6)进行的系统研究。我们发现,对于视觉任务,使用 n = 3 个示例能最好地平衡架构多样性与上下文聚焦。其次,我们引入了空白归一化哈希验证,这是一种轻量级去重方法(耗时小于 1 毫秒),相比 AST 解析提供了 100 倍的加速,并能防止对重复的计算机视觉架构进行冗余训练。在涵盖七个计算机视觉基准(MNIST、CIFAR-10、CIFAR-100、CelebA、ImageNette、SVHN、Places365)的大规模实验中,我们生成了 1900 个独特架构。我们还引入了一种数据集平衡的评估方法,以解决在异构视觉任务间比较架构的挑战。这些贡献为计算机视觉中基于 LLM 的架构搜索提供了可操作的指导,并建立了严格的评估实践,使计算资源有限的研究人员更容易进行自动化设计。
引用
@article{arxiv.2512.24120,
title = {Enhancing LLM-Based Neural Network Generation: Few-Shot Prompting and Efficient Validation for Automated Architecture Design},
author = {Raghuvir Duvvuri and Chandini Vysyaraju and Avi Goyal and Dmitry Ignatov and Radu Timofte},
journal= {arXiv preprint arXiv:2512.24120},
year = {2026}
}