预训练模型重用中任务与特征相关性的实证研究
机器学习
2025-11-13 v3 人工智能
摘要
预训练神经网络在机器学习社区中被广泛使用和重用。Alice 为特定任务训练了一个模型,而 Bob 将其神经网络的一部分重用于不同的任务,通常效果显著。我们应将 Bob 的成功归因于什么?本文引入了一种实验设置,通过该设置可以在计算机模拟中研究促成 Bob 实证成功的因素。结果表明,Bob 可能仅仅是运气好:他的任务准确率随其任务与 Alice 任务之间相关性的增加而单调递增。即使 Bob 的任务和输入特征与 Alice 的预训练网络可证明不相关,由于 Alice 对网络和优化器的选择,他也能取得显著优于随机猜测的性能。当任务之间几乎没有相关性时,仅重用较低的预训练层是更可取的,我们反之假设:重新训练的最优层数指示了任务和特征的相关性。最后,我们在受控的真实世界场景中表明,如果 Bob 与 Alice 的任务之间存在语义相关性,Bob 就能有效地重用 Alice 的预训练网络。
引用
@article{arxiv.2506.01975,
title = {An empirical study of task and feature correlations in the reuse of pre-trained models},
author = {Jama Hussein Mohamud and Willie Brink},
journal= {arXiv preprint arXiv:2506.01975},
year = {2025}
}