中文

高效稀疏训练与结构化 Dropout

机器学习 2024-11-05 v1

摘要

Dropout 是深度学习中常见的正则化技术,可提高泛化性能。尽管它引入稀疏性从而潜在提高吞吐量,但通常由于其非结构化性质,无法在 GPU 上实现速度提升。在本项目中,我对 SparseDrop——一种结构化、硬件友好型的 Dropout 变体进行了实验,该变体能够利用这种稀疏性。我提供了 SparseDrop 的 CUDA 实现,在稀疏率较低时即可实现对其稠密版本的速度提升。实证结果表明,SparseDrop 在正则化性能上与标准 Dropout 相当,甚至在某些情况下更佳。这表明它有潜力作为标准 Dropout 的即插即用替换方案,以实现更快的训练速度。源代码可在 https://github.com/andylolu2/sparse-dropout 获取。

关键词

引用

@article{arxiv.2411.01238,
  title  = {Efficient Sparse Training with Structured Dropout},
  author = {Andy Lo},
  journal= {arXiv preprint arXiv:2411.01238},
  year   = {2024}
}