迁移学习缩放定律的实证研究
机器学习
2024-09-02 v1
摘要
我们对 Transformer 模型中迁移学习的缩放定律进行了有限的实证研究。更具体地说,我们检验了一个包含“迁移差距”项的缩放定律,该定律指示了在一个分布上预训练对在另一个分布上优化下游性能的有效性。当迁移差距较低时,预训练是提升下游性能的一种成本效益高的策略。相反,当差距较高时,收集高质量微调数据变得相对更具成本效益。将缩放定律拟合到来自不同数据集的实验中,揭示了不同分布间迁移差距的显著变化。理论上,该缩放定律可为最优数据分配策略提供信息,并强调下游数据稀缺如何成为性能瓶颈。我们的发现为衡量迁移学习效率和理解数据可用性对能力的影响提供了一种原则性方法。
引用
@article{arxiv.2408.16947,
title = {An Empirical Study of Scaling Laws for Transfer},
author = {Matthew Barnett},
journal= {arXiv preprint arXiv:2408.16947},
year = {2024}
}