NOVAK:深度神经网络的统一自适应优化器
机器学习
2026-01-14 v1 人工智能
最优化与控制
摘要
本工作引入 NOVAK,一种模块化的基于梯度的优化算法,将自适应矩估计、学习率调度、解耦权重正则化、多种 Nesterov 动量变体以及前瞻同步集成到一个统一、面向性能的框架中。NOVAK 采用双模式架构,包含一个为生产环境设计的简化快速路径。该优化器采用自定义 CUDA 内核,为关键操作提供显著加速(加速 3-5 倍),同时在标准随机优化假设下保持数值稳定性。我们提供了关于自适应学习率校正、内存高效前瞻机制(将开销从 O(2p) 降低至 O(p + p/k))以及互补优化组件的协同耦合的完整数学公式。理论分析建立了收敛保证,阐明了该方法的稳定性和方差缩减特性。对 CIFAR-10、CIFAR-100、ImageNet 和 ImageNette 上的广泛实验评估表明,NOVAK 在 14 种当代优化器(包括 Adam、AdamW、RAdam、Lion 和 Adan)中表现优异。对于 ResNet-50、VGG-16 和 ViT 等各种架构,NOVAK 始终实现最先进的准确率,表现出卓越的鲁棒性,在 VGG-16/ImageNette 上取得非常高的准确率,显示出对当代优化器而言的优异的架构鲁棒性。结果凸显了 NOVAK 的架构贡献(特别是校正、解耦衰减和混合动量)对于可靠训练缺乏跳跃连接的深层普通网络具有至关重要的作用,解决了现有自适应优化方法长期以来的局限性。
关键词
引用
@article{arxiv.2601.07876,
title = {NOVAK: Unified adaptive optimizer for deep neural networks},
author = {Sergii Kavun},
journal= {arXiv preprint arXiv:2601.07876},
year = {2026}
}
备注
77 pages, 14 figures, 7 tables