中文

稀疏率降低在类Transformer模型中的深入探讨

机器学习 2024-11-27 v1

摘要

深度神经网络长期以来都因是黑箱而受到批评。为揭示现代神经网络架构的内部工作机制,最近的工作 \cite{yu2024white} 提出了一种称为稀疏率降低(Sparse Rate Reduction, SRR)的信息论目标函数,并将其展开的优化解释为一种称为编码率降低转换器(Coding Rate Reduction Transformer, CRATE)的类Transformer模型。然而,该研究的焦点主要在于基本实现,是否存在该目标在实际中被优化,以及其与泛化性的因果关系仍不明朗。超越本研究,我们通过分析CRATE的层级行为,理论和实证地推导出不同的实现方式。为揭示SRR对泛化性的预测力,我们收集了由不同实现方式和超参数诱导出的模型变体集合,并评估SRR作为复杂性度量,其与泛化性的相关性。令人惊讶的是,我们发现SRR具有正的相关系数,并优于其他基线度量,如路径范数和锐度基准度量。此外,我们展示了在基准图像分类数据集上使用SRR作为正则化可提高泛化性。我们希望本论文能为利用SRR设计原则模型并研究其泛化能力提供指导。

关键词

引用

@article{arxiv.2411.17182,
  title  = {An In-depth Investigation of Sparse Rate Reduction in Transformer-like Models},
  author = {Yunzhe Hu and Difan Zou and Dong Xu},
  journal= {arXiv preprint arXiv:2411.17182},
  year   = {2024}
}

备注

NeurIPS 2024