中文

面向极大型输出空间的内存高效训练——在单块商用 GPU 上学习 50 万标签

机器学习 2023-11-08 v1 人工智能 分布式、并行与集群计算

摘要

在具有大型输出空间(多达数百万标签)的分类问题中,最后一层可能需要极大的内存。使用稀疏连接将大幅降低内存需求,但正如我们下文所示,这会导致模型预测性能显著下降。幸运的是,我们发现可通过引入一个中间尺寸的倒数第二层来缓解此问题。我们进一步证明,可以将稀疏层的连接限制为均匀的,即每个输出神经元具有完全相同的传入连接数。这使得在 GPU 硬件上能够高效实现稀疏矩阵乘法与连接重分配。通过定制的 CUDA 实现,我们展示了所提方法可扩展到在仅 4GB 内存的单块商用 GPU 上处理含 670,000 个标签的数据集。

关键词

引用

@article{arxiv.2306.03725,
  title  = {Towards Memory-Efficient Training for Extremely Large Output Spaces -- Learning with 500k Labels on a Single Commodity GPU},
  author = {Erik Schultheis and Rohit Babbar},
  journal= {arXiv preprint arXiv:2306.03725},
  year   = {2023}
}