Frankenstein 优化器:通过重新审视优化技巧来挖掘潜力
机器学习
2025-05-06 v2
摘要
基于梯度的优化推动了现代深度神经网络模型在各种应用中前所未有的性能。自适应算法因其快速的收敛速率而加速了神经网络训练;然而,它们难以可靠地找到“平坦极小值”,导致与随机梯度下降 (SGD) 相比泛化能力次优。通过重新审视各种自适应算法的机制,我们提出了 Frankenstein 优化器,它结合了它们的优势。所提出的 Frankenstein 根据优化器的当前状态动态调整一阶和二阶动量系数,以直接保持一致的学习动态并立即反映梯度的突然变化。在计算机视觉、自然语言处理、少样本学习和科学模拟等多个研究领域的广泛实验表明,Frankenstein 在收敛速度和泛化性能方面在经验上超越了现有的自适应算法和 SGD。此外,本研究通过中心核对齐分析和学习过程中的损失景观可视化,加深了我们对自适应算法的理解。代码可在 https://github.com/acctouhou/Frankenstein_optimizer 获取。
引用
@article{arxiv.2503.02147,
title = {Frankenstein Optimizer: Harnessing the Potential by Revisiting Optimization Tricks},
author = {Chia-Wei Hsu and Nien-Ti Tsou and Yu-Cheng Chen and Yang Jeong Park and Ju Li},
journal= {arXiv preprint arXiv:2503.02147},
year = {2025}
}