中文

广义结构化矩阵的可微学习及其在高效深度神经网络中的应用

机器学习 2024-03-11 v2 人工智能 计算机视觉与模式识别 图像与视频处理 信号处理

摘要

本文研究高效的深度神经网络(DNNs),以具备所需性质的结构化矩阵替代稠密非结构化权重矩阵。挑战在于,流行神经网络模型中最优权重矩阵结构在大多数情况下并不明晰,且即便在同一网络中也可能随层而异。先前为高效 DNN 提出的多数结构化矩阵为手工设计,缺乏系统性学习它们的统一框架。为解决此问题,我们提出一种广义可微框架,通过梯度下降学习权重矩阵的高效结构。我们首先定义一类新的结构化矩阵,通过调整结构参数涵盖文献中广泛的结构化矩阵。随后,采用基于高斯-狄利克雷核的频域可微参数化方案,通过近端梯度下降学习结构参数。在图像与语言任务上,我们的方法以结构化矩阵学习高效 DNN,相较采用低秩、块稀疏或块低秩矩阵的已有方法,实现了更低的复杂度和/或更高的性能。

关键词

引用

@article{arxiv.2310.18882,
  title  = {Differentiable Learning of Generalized Structured Matrices for Efficient Deep Neural Networks},
  author = {Changwoo Lee and Hun-Seok Kim},
  journal= {arXiv preprint arXiv:2310.18882},
  year   = {2024}
}