预训练与 Lasso
统计方法学
2024-10-31 v5
摘要
预训练是机器学习中一种流行且强大的范式,用于将信息从一个模型传递到另一个模型。举例来说,假设有一个中等规模的猫和狗的图像数据集,并计划拟合一个深度神经网络以从像素特征对它们进行分类。通过预训练,我们从一个在包含数百种其他图像类型(不仅限于猫和狗)的大型图像语料库上训练过的神经网络开始。然后我们固定除顶层(进行最终分类的层)之外的所有网络权重,并在我们的数据集上训练(或“微调”)这些权重。这通常比仅在我们的较小数据集上训练的网络产生显著更好的性能。在本文中,我们提出问题:“预训练能帮助 Lasso 吗?”我们开发了一个 Lasso 框架,在该框架中,首先将模型拟合到大型数据集上,然后使用较小的数据集进行微调。后一个数据集可以是原始数据集的子集,也可以是具有不同但相关结果的数据集。该框架具有广泛的应用,包括分层模型、多项式响应、多响应模型、条件平均处理效应估计乃至梯度提升。在分层模型设置中,预训练的 Lasso 流程在第一阶段估计所有组共有的系数,然后在第二阶段“微调”估计特定组的系数。我们证明,在适当假设下,共有系数的恢复率优于仅在单个组上训练的常规 Lasso。这种对共有系数和个体系数的单独识别对于科学理解也很有用。
引用
@article{arxiv.2401.12911,
title = {Pretraining and the Lasso},
author = {Erin Craig and Mert Pilanci and Thomas Le Menestrel and Balasubramanian Narasimhan and Manuel Rivas and Stein-Erik Gullaksen and Roozbeh Dehghannasiri and Julia Salzman and Jonathan Taylor and Robert Tibshirani},
journal= {arXiv preprint arXiv:2401.12911},
year = {2024}
}