用于资源高效语言模型在线预训练优化的多臂老虎机:以动态掩码为例
计算与语言
2023-05-31 v2 机器学习
机器学习
摘要
我们设计并评估了一个用于基于 Transformer 的语言模型(TLM)资源高效预训练的贝叶斯优化框架。TLM 预训练需要高昂的计算资源,并引入许多未解决的设计选择,例如选择其预训练超参数。我们提出了一种用于顺序选择 TLM 预训练超参数的多臂老虎机框架,旨在以资源高效的方式优化语言模型性能。我们设计了一种 Thompson 采样算法,带有掩码语言模型(MLM)预训练目标的代理高斯过程奖励模型,用于其顺序最小化。与采用固定掩码概率的 MLM 预训练不同,所提出的基于高斯过程的 Thompson 采样(GP-TS)通过顺序选择可改善性能的掩码超参数来加速预训练。我们通过经验证明 GP-TS 如何高效地预训练语言模型,即在更少的轮次内实现更低的 MLM 损失,且适用于多种设置。此外,GP-TS 预训练的 TLM 取得了具有竞争力的下游性能,同时避免了昂贵的超参数网格搜索。GP-TS 提供了一种用于高效且优化的 TLM 预训练的交互式框架,其通过规避昂贵的超参数选择,实现了可观的计算节省。
引用
@article{arxiv.2203.13151,
title = {Multi-armed bandits for resource efficient, online optimization of language model pre-training: the use case of dynamic masking},
author = {Iñigo Urteaga and Moulay-Zaïdane Draïdia and Tomer Lancewicki and Shahram Khadivi},
journal= {arXiv preprint arXiv:2203.13151},
year = {2023}
}
备注
Work accepted for publication at ACL Findings 2023. The code used for this study is publicly available at https://github.com/iurteaga/gp_ts_nlp