中文

LoRanPAC:低秩随机特征与预训练模型用于连续学习中的理论与实践桥接

机器学习 2025-05-20 v3

摘要

连续学习(CL)的目标是训练能够解决多个依次呈现任务的模型。最近的 CL 方法通过利用能够对下游任务具有良好泛化性的大型预训练模型来实现卓越的性能。但这些方法缺乏理论保证,容易引发意外失败。相反,原则性的 CL 方法往往难以实现具有竞争力的性能。本文旨在通过设计一种简单且性能卓越、同时具备理论依据的 CL 方法来弥合这一差距。具体而言,我们将预训练特征提升到更高维空间,并构建一个过参数化的最小范数最小二乘问题。我们发现提升后的特征高度病态,可能导致较大的训练误差(数值不稳定)和更高的泛化误差。我们通过不断对提升后的特征进行奇异值分解截断来解决这些挑战。我们称之为 LoRanPAC 的方法在超参数选择上具有稳定性,可处理数百个任务,并在多个数据集上优于最新的 CL 方法。重要的是,我们的方法在其连续学习过程中满足递推关系,这使我们能够通过适当地截断部分奇异值分解因子来证明其保持小的训练和测试误差。这导致该方法在保持强大经验性能的同时也具备理论保证。代码可在 https://github.com/liangzu/loranpac 获取。

关键词

引用

@article{arxiv.2410.00645,
  title  = {LoRanPAC: Low-rank Random Features and Pre-trained Models for Bridging Theory and Practice in Continual Learning},
  author = {Liangzu Peng and Juan Elenter and Joshua Agterberg and Alejandro Ribeiro and René Vidal},
  journal= {arXiv preprint arXiv:2410.00645},
  year   = {2025}
}

备注

47 pages, 18 figures, 16 tables (v3, accepted to ICLR 2025)