动态通用逼近理论:深度学习计算机视觉模型的基本理论
计算机视觉与模式识别
2024-12-02 v4 人工智能
摘要
计算机视觉(CV)是人工智能中最关键的领域之一。近年来,设计了各种基于卷积神经网络(CNN)和 Transformer 的深度学习模型,以解决 CV 中的各种问题。这些算法在机器人和人脸识别等领域找到了实际应用。尽管当前 CV 模型的能力不断提升,但仍有若干根本性问题未得到解决:CNN 为何需要深层结构?CNN 的何种因素确保了其泛化能力?残差网络为何优于像 VGG 这样的全卷积网络?残差 CNN 与 Transformer 网络之间存在何种根本区别?为何 CNN 能够运用 LoRA 和剪枝技术?这些问题的根本原因在于缺乏对 CV 领域深度学习模型的稳健理论基础。为解决这些关键问题和技术,本文运用通用逼近定理(UAT),为 CV 领域的卷积和 Transformer 模型提供理论依据。通过这种方式,我们旨在从理论视角阐明这些问题。
引用
@article{arxiv.2407.17480,
title = {Dynamic Universal Approximation Theory: The Basic Theory for Deep Learning-Based Computer Vision Models},
author = {Wei Wang and Qing Li},
journal= {arXiv preprint arXiv:2407.17480},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2407.00958