中文

单 GPU 上的可扩展模型汤学习:一种高效子空间训练策略

机器学习 2024-07-24 v2

摘要

预训练后微调是实践中广泛采用的策略,可通过"model soups"~\cite{wortsman2022model}探索各种超参数配置来提升性能。Learned-Soup 这种模型汤的变体显著提高了性能,但由于(i)需要同时加载所有微调模型以及(ii)包含所有微调模型的大型计算图,导致在内存和时间成本方面存在挑战。本文提出了 Memory Efficient Hyperplane Learned Soup(MEHL-Soup),通过将已学习的汤形式化为超平面优化问题,并引入块坐标梯度下降来学习混合系数。每次迭代时,MEHL-Soup 只需加载少量微调模型并构建一个合并模型的计算图。我们进一步将 MEHL-Soup 扩展为 MEHL-Soup+,以层级方式实现。在各种 ViT 模型和数据集上的实验结果表明,MEHL-Soup(+) 在测试准确率方面优于 Learned-Soup(+),内存使用减少了超过 13×13\times。此外,MEHL-Soup(+) 可在单张 GPU 上运行,相较于 Learned-Soup 快 9 倍。代码已发布于 https://github.com/nblt/MEHL-Soup。

关键词

引用

@article{arxiv.2407.03641,
  title  = {Learning Scalable Model Soup on a Single GPU: An Efficient Subspace Training Strategy},
  author = {Tao Li and Weisen Jiang and Fanghui Liu and Xiaolin Huang and James T. Kwok},
  journal= {arXiv preprint arXiv:2407.03641},
  year   = {2024}
}

备注

ECCV 2024