中文

SWAT-NN:在潜在空间中同时训练神经网络的权重与架构

机器学习 2025-11-19 v3

摘要

设计神经网络通常依赖于人工试错,或先进行神经架构搜索 (NAS) 再进行权重训练。前者耗时且费力,而后者通常将架构搜索与权重优化离散化处理。在本文中,我们提出了一种根本不同的方法,可同时优化神经网络的架构与权重。我们的框架首先训练一个通用的多尺度自编码器,将架构信息与参数信息嵌入到一个连续的潜在空间中,其中功能相似的神经网络被映射得更近。给定一个数据集后,我们在该嵌入空间中随机初始化一个点,并通过梯度下降对其进行更新以获得最优神经网络,联合优化其结构与权重。优化过程引入了稀疏性与紧凑性惩罚,以促进生成高效的模型。在合成回归任务上的实验表明,我们的方法能够有效发现性能强劲的稀疏且紧凑的神经网络。

关键词

引用

@article{arxiv.2506.08270,
  title  = {SWAT-NN: Simultaneous Weights and Architecture Training for Neural Networks in a Latent Space},
  author = {Zitong Huang and Mansooreh Montazerin and Ajitesh Srivastava},
  journal= {arXiv preprint arXiv:2506.08270},
  year   = {2025}
}

备注

Accepted to 2025 IEEE International Conference on Big Data