中文

基于稀疏树的神经网络初始化

机器学习 2022-10-03 v1 机器学习

摘要

专用的神经网络(NN)架构已被设计用于处理特定数据类型(如用于图像的 CNN 或用于文本的 RNN),这使它们在处理这些数据时位列最先进方法之中。遗憾的是,迄今尚未发现用于处理表格数据的架构,而树集成方法(树提升、随机森林)通常展现出最佳的预测性能。在这项工作中,我们提出一种用于(可能深度的)多层感知机(MLP)的新的稀疏初始化技术:我们首先训练基于树的流程以检测特征交互,并利用所得信息初始化网络,随后通过标准随机梯度策略进行训练。在多个表格数据集上的数值实验表明,这一新的、简单易用的方法在泛化能力与计算时间上均是默认 MLP 初始化乃至现有复杂深度学习方案的有力竞争者。事实上,这种明智的 MLP 初始化将所得 NN 方法提升至在处理表格数据时梯度提升的有效竞争对手水平。此外,此类初始化能够在训练过程中保持网络首层引入的权重稀疏性。这一事实表明,这一新初始化器在 NN 训练中执行了隐式正则化,并强调首层充当了稀疏特征提取器(如同 CNN 中的卷积层)。

关键词

引用

@article{arxiv.2209.15283,
  title  = {Sparse tree-based initialization for neural networks},
  author = {Patrick Lutz and Ludovic Arnould and Claire Boyer and Erwan Scornet},
  journal= {arXiv preprint arXiv:2209.15283},
  year   = {2022}
}