中文

测试 RadiX-Nets:可行稀疏拓扑结构的进展

机器学习 2023-11-08 v1

摘要

数据的指数级增长引发了对机器学习研究与工业应用的计算需求。对超参数化深度神经网络(DNNs)进行稀疏化,可创建复杂数据的更简洁表示。以往研究表明,某些稀疏网络能达到与稠密网络相近的性能,同时降低运行时间与存储开销。RadiX-Nets 作为稀疏 DNNs 的一个子类,保持了均匀性,从而抵消了其神经连接缺失的影响。其生成过程独立于稠密网络,带来更快的渐近训练速度,并免去了昂贵的剪枝需求。然而,关于 RadiX-Nets 的研究甚少,使得测试颇具挑战。本文提出了一套基于 TensorFlow 的 RadiX-Nets 测试套件。我们测试 RadiX-Net 性能,以简化可扩展模型中的处理流程,揭示了网络拓扑、初始化与训练行为之间的关系。我们还遇到了“奇怪模型”,它们训练不稳定且精度较低,而相似稀疏度的模型训练良好。

关键词

引用

@article{arxiv.2311.03609,
  title  = {Testing RadiX-Nets: Advances in Viable Sparse Topologies},
  author = {Kevin Kwak and Zack West and Hayden Jananthan and Jeremy Kepner},
  journal= {arXiv preprint arXiv:2311.03609},
  year   = {2023}
}

备注

5 pages, 8 figures, accepted to IEEE URTC 2023