中文

漂移后何时重训练:基于数据的后漂移数据规模充分性测试

机器学习 2026-05-21 v2

摘要

突发概念漂移使先前训练的预测器变得不可靠,但如何决定何时重训练以及何种后漂移数据规模足以充分训练,很少被关注。我们提出CALIPER——一个无检测器和模型依赖、仅基于数据的方法,用于估计稳定重训练所需的后漂移数据规模。CALIPER利用动态系统生成的序列中的状态依赖性:我们在后漂移窗口上运行单遍加权局部回归,并跟踪一个一步代理误差作为局部参数θ的函数。当有效样本量门槛满足时,该误差随局部参数增大而单调非递增趋势表明数据规模足以充分信息用于重训练。我们还提供了该方法的理论分析,展示算法具有低的每更新时间和内存开销。在来自四个异构领域的数据集、三个学习器家族和两个检测器中,CALIPER始终匹配或优于最佳固定数据规模用于重训练,同时几乎不产生额外开销,常常优于增量更新。CALIPER在流式学习中弥合了漂移检测与数据充分适应之间的差距。

关键词

引用

@article{arxiv.2603.09024,
  title  = {When to Retrain after Drift: A Data-Only Test of Post-Drift Data Size Sufficiency},
  author = {Ren Fujiwara and Yasuko Matsubara and Yasushi Sakurai},
  journal= {arXiv preprint arXiv:2603.09024},
  year   = {2026}
}

备注

Accepted by ICLR 2026