TrAct:使第一层预激活可训练
机器学习
2024-11-01 v1 计算机视觉与模式识别
摘要
我们考虑视觉模型第一层的训练,并注意到像素值与梯度更新幅度之间的明确关系:到达第一层权重的梯度,根据定义,与(归一化的)输入像素值成正比。因此,低对比度图像对学习的影响小于高对比度图像,而非常亮或非常暗的图像对权重的影响强于亮度适中的图像。在这项工作中,我们提出对模型第一层产生的嵌入执行梯度下降。然而,对于视觉模型来说,切换到带有嵌入层的离散输入并不是一个合理的选择。因此,我们提出了一个概念性过程:(i) 对第一层激活执行梯度下降步骤以构建激活提议,以及 (ii) 寻找第一层的最优权重,即那些最小化到激活提议的平方距离的权重。我们提供了该过程的闭式解,并对其进行了调整,以实现稳健的随机训练,同时高效地计算所有内容。从经验上看,我们发现TrAct(训练激活)将训练速度提高了1.25倍到4倍,同时仅需要很小的计算开销。我们展示了TrAct与不同优化器在一系列不同视觉模型(包括卷积和Transformer架构)上的实用性。
引用
@article{arxiv.2410.23970,
title = {TrAct: Making First-layer Pre-Activations Trainable},
author = {Felix Petersen and Christian Borgelt and Stefano Ermon},
journal= {arXiv preprint arXiv:2410.23970},
year = {2024}
}
备注
Published at NeurIPS 2024