中文

基于切换状态空间模型的非平稳时间序列学习推迟

机器学习 2026-05-21 v2 应用统计

摘要

学习推迟(L2D)将每个决策路由到系统自己的预测器或外部专家。流式时间序列设置破坏了离线L2D假设:数据是非平稳的,专家可用性随时间变化,内部预测器是在线训练的。我们提出L2D-SLDS,一个基于在所有潜在残差上构建的分解式切换线性-高斯状态空间模型的单阶段在线L2D框架:一个离散制度、一个共享的全局因子以及每个专家独特的状态。始终被观测的内部残差持续更新对每个未查询专家的信念,通过共享因子实现, learner-aware query score 在即时成本与潜状态信息增益以及一步 learner 改进之间进行权衡。我们对一个时间可变的 learn-and-defer comparator 进行了下界不等式, 将 regret 分解为 query-bonus 预算、SLDS预测成本误差项ESLDS\mathcal{E}_{\mathrm{SLDS}}以及内部学习者的区间动态 regret。在合成数据、墨尔本、Jena和24位专家德里尔 benchmarks 上,L2D-SLDS 在与情境-和非平稳-bandit 基线相当或优于,同时在实数据中仅在<2%{<}2\%的 round 中进行推迟。

关键词

引用

@article{arxiv.2601.22538,
  title  = {Learning to Defer in Non-Stationary Time Series via Switching State-Space Models},
  author = {Yannis Montreuil and Letian Yu and Axel Carlier and Lai Xing Ng and Wei Tsang Ooi},
  journal= {arXiv preprint arXiv:2601.22538},
  year   = {2026}
}