中文

基于多臂老虎机的在线曲率感知回放:利用二阶信息进行在线持续学习

机器学习 2025-02-05 v1 人工智能

摘要

在线持续学习 (OCL) 模型不断适应非平稳数据流,通常不依赖任务信息。此类环境复杂,许多传统 CL 方法会失败,而基于回放的在线方法则在任务迁移后会遭受不稳定问题。为解决此问题,我们将基于回放的 OCL 形式化为在回放数据上进行具有显式 KL 散度约束的二阶联合优化。我们提出了在线曲率感知回放 (Online Curvature-Aware Replay, OCAR) 以解决该问题:一种利用 Fisher 信息矩阵 (FIM) 的 K-FAC 近似来对梯度进行 preconditioning 的方法。FIM 作为稳定器可防止遗忘,同时也能加速非干扰方向上的优化。我们展示了如何将 FIM 估计适应持续学习环境,以稳定非 i.i.d. 数据的二阶优化,揭示了 Tikhonov 正则化在稳定-塑性权衡中的作用。经验结果表明,OCAR 在持续学习指标上超越了最先进的方法,在三个不同基准测试中实现了更高的平均准确率。

关键词

引用

@article{arxiv.2502.01866,
  title  = {Online Curvature-Aware Replay: Leveraging $\mathbf{2^{nd}}$ Order Information for Online Continual Learning},
  author = {Edoardo Urettini and Antonio Carta},
  journal= {arXiv preprint arXiv:2502.01866},
  year   = {2025}
}