中文

动态通用逼近理论:深度学习计算机视觉模型的基本理论

计算机视觉与模式识别 2024-12-02 v4 人工智能

摘要

计算机视觉(CV)是人工智能中最关键的领域之一。近年来,设计了各种基于卷积神经网络(CNN)和 Transformer 的深度学习模型,以解决 CV 中的各种问题。这些算法在机器人和人脸识别等领域找到了实际应用。尽管当前 CV 模型的能力不断提升,但仍有若干根本性问题未得到解决:CNN 为何需要深层结构?CNN 的何种因素确保了其泛化能力?残差网络为何优于像 VGG 这样的全卷积网络?残差 CNN 与 Transformer 网络之间存在何种根本区别?为何 CNN 能够运用 LoRA 和剪枝技术?这些问题的根本原因在于缺乏对 CV 领域深度学习模型的稳健理论基础。为解决这些关键问题和技术,本文运用通用逼近定理(UAT),为 CV 领域的卷积和 Transformer 模型提供理论依据。通过这种方式,我们旨在从理论视角阐明这些问题。

关键词

引用

@article{arxiv.2407.17480,
  title  = {Dynamic Universal Approximation Theory: The Basic Theory for Deep Learning-Based Computer Vision Models},
  author = {Wei Wang and Qing Li},
  journal= {arXiv preprint arXiv:2407.17480},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2407.00958