适应性数据选择在迁移学习中的可重复性:理论与实证分析
机器学习
2025-09-01 v2
摘要
迁移学习的广泛采用已彻底变革了机器学习,通过使预训练模型高效适配新领域实现了突破。然而,这些适应的可靠性仍不为人所了解,尤其是当采用动态优先训练样本的自适应数据选择策略时。我们提出了迁移学习中可重复性的全面理论与实证分析,引入数学框架量化适应效果与结果一致性之间的根本性权衡。我们的关键贡献是形式化了选择灵敏度 (),该度量捕捉自适应选择策略对训练数据扰动的响应方式。我们证明,可重复性失败概率——即两个独立训练运行产生模型性能差异超过阈值的可能性——随选择灵敏度的平方增长,同时随样本量的指数衰减。通过在 MultiNLI 语料库上使用六种自适应选择策略(从均匀抽样到梯度基于选择)进行大量实验,我们证明了这一理论关系在实践中精确成立。我们的结果显示,高度自适应的策略如梯度基于和课程学习在任务性能上取得优势,但可重复性失败率较高;而较不自适应的方法可将失败率控制在7%以下。关键的是,我们表明源域预训练提供了强大的缓解机制,在保持性能提升的同时将失败率降低最高可达30%。这些发现为实践者提供了原则化的指南,以在性能与可重复性之间进行权衡,并凸显了现代迁移学习系统中可重复性意识设计的必要性。
关键词
引用
@article{arxiv.2508.04901,
title = {Sensitivity of Stability: Theoretical & Empirical Analysis of Replicability for Adaptive Data Selection in Transfer Learning},
author = {Prabhav Singh and Jessica Sorrell},
journal= {arXiv preprint arXiv:2508.04901},
year = {2025}
}
备注
24 Pages, 5 Figures