因子化神经层的初始化与正则化
机器学习
2022-10-07 v2 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
因子化层——由两个以上矩阵乘积参数化的运算——出现在多种深度学习场景中,包括压缩模型训练、某些类型的知识蒸馏以及多头自注意力架构。我们研究如何初始化和正则化含此类层的深度网络,考察两种简单且少被研究的方案:谱初始化与 Frobenius 衰减,以提升其性能。指导性见解是为这些网络设计尽可能接近其调优良好、未分解对应物的优化例程;我们以初始化与正则化方案如何影响梯度下降训练的分析支撑该直觉,借鉴现代对权重衰减与批归一化相互作用的理解。经验上,我们凸显了谱初始化与 Frobenius 衰减在多种设置下的益处。在模型压缩中,我们展示它们使低秩方法在训练低内存残差网络任务上显著优于非结构化稀疏与张量方法;这些方案的类似形式也改善了张量分解技术的性能。对于知识蒸馏,Frobenius 衰减启用了一个简单的、过完备的基线,可从过参数化训练中产出紧凑模型而无需以教师网络重训练或剪枝。最后,我们展示将两方案应用于多头注意力如何在翻译与无监督预训练上带来性能提升。
引用
@article{arxiv.2105.01029,
title = {Initialization and Regularization of Factorized Neural Layers},
author = {Mikhail Khodak and Neil Tenenholtz and Lester Mackey and Nicolò Fusi},
journal= {arXiv preprint arXiv:2105.01029},
year = {2022}
}
备注
ICLR 2021 camera-ready, amended due to error pointed out in arXiv:2209.13569v1 (amendment shown in blue)