中文

PDAC:基于概率密度感知的持续学习高效核心集选择方法

机器学习 2025-11-13 v1

摘要

基于再训练的持续学习(CL)维护有限的内存缓冲区以存储回放样本,使得这些方法高度依赖所存储样本的质量。当前主流的基于再训练的 CL 方法通常通过选择代表性子集(即核心集)来构建内存缓冲区,以最小化存储开销而拟合完整数据集的训练效果。然而,主流的核心集选择(CS)方法通常将 CS 问题形式化为双层优化问题,依赖大量内外迭代,导致计算成本高昂,限制了实际效率。本文旨在提供更高效的核心集构建逻辑与方案。首先,我们从局部误差分解的视角分析缓冲区训练模型与贝叶斯最优模型之间的均方误差(MSE),探讨不同区域样本对 MSE 抑制贡献。进一步的理论与实验分析表明,高概率密度的样本在误差抑制中起主导作用。基于此,我们提出概率密度感知核心集(PDAC)方法。PDAC 利用投影高斯混合(PGM)模型估计每个样本的联合密度,实现基于密度的优先级缓冲区选择。最后,我们引入流式期望最大化(EM)算法以增强 PGM 参数对流式数据的适应性,形成用于流式场景的流式 PDAC(SPDAC)。大量对比实验表明,我们的方法在各种 CL 设置下均优于其他基线方法,同时保持良好的效率。

关键词

引用

@article{arxiv.2511.09487,
  title  = {PDAC: Efficient Coreset Selection for Continual Learning via Probability Density Awareness},
  author = {Junqi Gao and Zhichang Guo and Dazhi Zhang and Yao Li and Yi Ran and Biqing Qi},
  journal= {arXiv preprint arXiv:2511.09487},
  year   = {2025}
}