SEKI:基于大语言模型的自演化与知识启发式神经网络架构搜索
计算与语言
2025-03-03 v1 人工智能
摘要
我们提出SEKI,一种新型基于大语言模型(LLM)的神经网络架构搜索(NAS)方法。灵感来自现代LLM中的链律思维(CoT)范式,SEKI在两个关键阶段 operate: 自演化和知识蒸馏。在自演化阶段,LLM最初缺乏足够的参考示例,因此我们实现一种迭代精炼机制,基于性能反馈改进架构。随着时间推移,这一过程积累了一批高性能架构。在知识蒸馈阶段,LLM分析这些架构之间的常见模式,以生成新的优化设计。将这两个阶段结合起来,SEKI充分利用了LLM在NAS方面的能力,且无需任何领域特定数据。实验结果表明,SEKI在各种数据集和搜索空间上实现了最佳(SOTA)性能,仅需0.05 GPU天,在效率和准确性方面均优于现有方法。此外,SEKI显示出强大的泛化能力, 在多个任务上实现SOTA水平的竞争结果。
引用
@article{arxiv.2502.20422,
title = {SEKI: Self-Evolution and Knowledge Inspiration based Neural Architecture Search via Large Language Models},
author = {Zicheng Cai and Yaohua Tang and Yutao Lai and Hua Wang and Zhi Chen and Hao Chen},
journal= {arXiv preprint arXiv:2502.20422},
year = {2025}
}