作为极小基础模型的卷积网络:视觉提示与理论视角
计算机视觉与模式识别
2024-09-18 v1
摘要
与针对特定任务训练的深度神经网络相比,那些在 ImageNet 分类等通用数据集上训练的基础深度网络受益于更大规模的数据集、更简单的网络结构和更容易的训练技术。在本文中,我们设计了一个提示模块,用于将通用深度网络进行少样本适应到新任务。在学习理论的驱动下,我们推导出尽可能简单的提示模块,因为它们在相同的训练误差下泛化能力更好。我们以视频目标分割为案例进行实验。我们给出了一个具体的提示模块,即半参数深度森林,它结合了相关滤波、随机森林、图像引导滤波等几种非参数方法与为 ImageNet 分类任务训练的深度网络。从学习理论的角度来看,只要经验研究表明这种简单集成的训练误差可以达到与端到端训练的深度网络相当的结果,所有这些模型的 VC 维或复杂度都显著更小,因此往往泛化得更好。我们还提出了一种在视频目标分割设置下分析泛化能力的新方法,以使界限更紧。在实践中,SDForest 的计算成本极低,甚至在 CPU 上也能实现实时。我们在视频目标分割任务上进行了测试,在 DAVIS2016 和 DAVIS2017 上取得了与纯深度学习方法相媲美的竞争性能,且无需任何训练或微调。
引用
@article{arxiv.2409.10555,
title = {Convolutional Networks as Extremely Small Foundation Models: Visual Prompting and Theoretical Perspective},
author = {Jianqiao Wangni},
journal= {arXiv preprint arXiv:2409.10555},
year = {2024}
}