中文

动态通用逼近理论:神经网络并行性的基础

机器学习 2024-12-02 v5 人工智能

摘要

神经网络正日益演变为训练大规模模型以处理大数据的方法,这种方法在众多任务中已显示出优异性能。然而,这种方法引入了一个迫切的问题:当前的深度学习模型主要是串行的,随着网络层数的增加,训练和推理时间也随之增加。这在深度学习继续向前发展的情况下是不可接受的。因此,本文提出一种基于通用逼近定理 (UAT) 的深度学习并行策略。基于此,我们设计了一个名为 Para-Former 的并行网络来测试我们的理论。不同于传统的串行模型,Para-Former 的推理时间不会随层数的增加而增加,显著加速了多层网络的推理速度。实验结果验证了该网络的有效性。

关键词

引用

@article{arxiv.2407.21670,
  title  = {Dynamic Universal Approximation Theory: Foundations for Parallelism in Neural Networks},
  author = {Wei Wang and Qing Li},
  journal= {arXiv preprint arXiv:2407.21670},
  year   = {2024}
}