用于选择预训练检查点的贝叶斯模型选择准则
机器学习
2025-05-30 v2
摘要
近期的人工智能进展得益于 foundation 模型(如 BERT、GPT、T5 和 Vision Transformer)的发展。这些模型首先在大规模且多样化的数据集上进行预训练,然后适应特定的下游任务,通常数据量显著减少。然而,关于这些普遍的预训练-适应范式背后机制的探索仍不充分,尤其是哪些预训练检查点的特征有助于下游适应。我们引入一种贝叶斯模型选择准则,称为下游自由能,它量化了检查点对适应性的程度,通过测量下游任务附近有利参数的浓度。我们演示了这种贝叶斯模型选择准则可以在没有下游数据或对下游任务先验知识的情况下有效实现。此外,我们提供了实证证据表明,该准则可靠地与改进的微调性能相关,为预测模型适应性提供了原则方法。
引用
@article{arxiv.2410.05612,
title = {A Bayesian Model Selection Criterion for Selecting Pretraining Checkpoints},
author = {Michael Munn and Susan Wei},
journal= {arXiv preprint arXiv:2410.05612},
year = {2025}
}
备注
Accepted as an ICML 2025 paper