LLM 作为神经架构:严格 API 约束下的图像字caption模型生成
机器学习
2025-12-18 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
神经网络架构搜索(NAS)传统上需要大量人类专业知识或自动试错才能设计深度学习模型。我们提出了 NN-Caption,一个由 LLM 指导的神经网络架构搜索管道,通过在严格的 Net API 约束下组合 CNN 编码器(来自 LEMUR 的分类 backbones)和序列解码器(LSTM/GRU/Transformer)生成可运行的图像字caption模型。我们使用 DeepSeek-R1-0528-Qwen3-8B 作为主要生成器,展示了 prompt 模板和生成架构示例。在 MS COCO 上进行评估,BLEU-4 指标表明 LLM 生成的模型数量众多,其中超过半数成功训练并产生有意义的字caption。我们分析了在 prompt 中使用不同数量输入模型片段(5 vs. 10)的效果,发现提供更多候选组件时成功率略有下降。我们还报告了训练动力学(字caption 准确率 vs. 迭代次数)以及最高 BLEU-4 分数。我们的结果凸显了 LLM 指导 NAS 的潜力:LLM 不仅提出架构,还建议超参数和训练实践。我们识别了遇到的挑战(如代码幻觉或 API 合规性问题),并详细说明了如何通过 prompt 规则和迭代代码修复来解决这些问题。本工作提出了一个集成 prompt-based 代码生成与自动评估的管道,并为开放 LEMUR 数据集添加了数十个新型字caption模型,以促进可重复的基准测试和后续 AutoML 研究。
引用
@article{arxiv.2512.14706,
title = {LLM as a Neural Architect: Controlled Generation of Image Captioning Models Under Strict API Contracts},
author = {Krunal Jesani and Dmitry Ignatov and Radu Timofte},
journal= {arXiv preprint arXiv:2512.14706},
year = {2025}
}