通过记忆化感知降低机器学习、视觉和语言模型训练流程中的超参数调优成本
机器学习
2024-11-07 v1 机器学习
摘要
机器学习、视觉和语言模型的训练或微调通常实现为一个流程:一系列阶段,包括数据准备、模型训练和评估。在本文中,我们利用流程结构来降低模型训练/微调的超参数调优成本,这对于语言模型尤其有价值,因为其GPU天数成本高昂。我们提出了一种“记忆化感知”的贝叶斯优化(BO)算法EEIPU,该算法与流程缓存系统协同工作,使其能够比其它调优算法在每个GPU天内评估显著更多的超参数候选。结果是,在相同的搜索时间内获得更高质量的超参数,或者等效地,减少达到相同超参数质量所需的搜索时间。在我们对机器学习(模型集成)、视觉(卷积架构)和语言(T5架构)流程的基准测试中,我们将EEIPU与最近的BO算法进行了比较:EEIPU在相同预算内平均多产生的超参数候选,并且验证指标的平均提升幅度比其它算法高(提升幅度从热身迭代结束时开始测量)。
引用
@article{arxiv.2411.03731,
title = {Reducing Hyperparameter Tuning Costs in ML, Vision and Language Model Training Pipelines via Memoization-Awareness},
author = {Abdelmajid Essofi and Ridwan Salahuddeen and Munachiso Nwadike and Elnura Zhalieva and Kun Zhang and Eric Xing and Willie Neiswanger and Qirong Ho},
journal= {arXiv preprint arXiv:2411.03731},
year = {2024}
}