中文

深度自编码器权重的扰动用于表格数据的模型压缩与分类

机器学习 2022-05-18 v1 人工智能 神经与进化计算

摘要

全连接深度神经网络(DNN)通常包含冗余权重,导致过拟合和高内存需求。此外,在表格数据分类中,DNN 的性能常常受到传统机器学习模型的挑战。在本文中,我们提出对 DNN 权重进行周期性扰动(剪枝与再生),尤其是在深度自编码器的自监督预训练阶段。所提出的权重扰动策略在六个表格数据集中的四个上,于下游分类任务中优于 dropout 学习。在相同预训练阶段对权重进行 L1 或 L2 正则化,其分类性能不如 dropout 或我们的权重扰动例程。与 dropout 学习不同,所提出的权重扰动例程还在六个表格数据集上额外实现了 15% 到 40% 的稀疏性,用于压缩深度预训练模型。我们的实验表明,当全连接 DNN 表现极差时,经过权重扰动或 dropout 的预训练深度自编码器在表格数据分类中可以优于传统机器学习。然而,当表格数据集包含不相关变量时,传统机器学习模型似乎优于任何深度模型。因此,深度模型的成功可归因于现实世界数据集中不可避免地存在相关变量。

关键词

引用

@article{arxiv.2205.08358,
  title  = {Perturbation of Deep Autoencoder Weights for Model Compression and Classification of Tabular Data},
  author = {Manar Samad and Sakib Abrar},
  journal= {arXiv preprint arXiv:2205.08358},
  year   = {2022}
}