预训练真的优于元学习吗?
机器学习
2025-09-24 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
在少样本学习背景下,目前普遍认为固定的预训练(PT)模型配合评估时微调最后一层,优于标准元学习算法。我们在对一组形式上多样的数据集进行深入实证检验的基础上重新评估这些论断,并将 PT 与模型无关元学习(MAML)进行比较。与以往工作不同,我们通过使用相同架构、相同优化器以及所有模型均训练至收敛来强调公平比较。关键的是,我们使用更严格的统计工具——效应量(Cohen's d)——来确定 PT 训练的模型与 MAML 之间差异的实际显著性。然后我们使用先前提出的度量——多样性系数——来计算数据集的平均形式多样性。通过该分析,我们证明如下:1. 当数据集的形式多样性较低时,PT 平均优于 MAML;2. 当形式多样性较高时,MAML 平均优于 PT。需要注意的是,使用效应量度量的 PT 与 MAML 之间平均差异的幅度较低(依据经典统计阈值)——小于 0.2。然而,该观察与当前认为预训练模型总是优于元学习模型的信念相反。我们广泛的实验考虑了 21 个少样本学习基准,包括大规模少样本学习数据集 Meta-Data set。我们还表明在 Openwebtext 上 GPT-2 的 MAML 模型与 PT 模型无显著差异。因此我们得出结论:预训练模型并非总是击败元学习模型,且数据集的形式多样性是一个驱动因素。
引用
@article{arxiv.2306.13841,
title = {Is Pre-training Truly Better Than Meta-Learning?},
author = {Brando Miranda and Patrick Yu and Saumya Goyal and Yu-Xiong Wang and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2306.13841},
year = {2025}
}