中文

分布漂移下的学习:先验可重复性作为内在统计资源

机器学习 2026-05-19 v4 机器学习

摘要

在分布漂移条件下进行统计学习仍然缺乏充分的表征,尤其是在学习会改变数据生成规律的闭环环境中。我们引入一种内在漂移预算 CTC_T,其量化了沿着学习者-环境轨迹所实现的数据分布在 Fisher-Rao 距离上的累计信息几何运动。该预算将外部环境变化与学习者行为引起的策略敏感反馈相分离。这给出了一种基于速率的先验可重复性表征:当用于预测在下一分布下对实际数据流的性能,以预测实际数据流上实际性能时,漂移贡献通过平均运动速率 CT/TC_T/T 进入,而非通过累计漂移alone。我们证明了一个阶为 T1/2+CT/TT^{-1/2}+C_T/T(高阶剩余项受控)的漂移反馈上界,并在一个标准正则子类上建立了匹配的锐度下界,以证明 CT/TC_T/T 的依赖性在常数因子上是紧致的:CT/TC_T/T 在上界控制上充分,而在正则硬子类上不可避免。我们进一步证明了一个信息论不可区分性结果,表明阶为 C/TC/T 的效应对一步前的目标不必从实际绩效流中被识别。最后,我们表明固定的监控信道会诱导收缩的可观测 Fisher 运动,实验(包括一个误指定的真实数据反馈情境)表明,恰当选择的信道可以在内在数据生成规律不可用时保留风险相关的漂移信号。该理论将外生漂移、自适应数据分析和表现性反馈视为沿同一学习者-环境轨迹的 Fisher-Rao 运动的不同来源。

关键词

引用

@article{arxiv.2512.13506,
  title  = {Learning under Distributional Drift: Prequential Reproducibility as an Intrinsic Statistical Resource},
  author = {Sofiya Zaichyk},
  journal= {arXiv preprint arXiv:2512.13506},
  year   = {2026}
}

备注

Revised: Added additional experiment. Clarified lower bound