流数据的点预测
机器学习
2024-08-05 v1 机器学习
摘要
我们提出了两种用于流数据点预测的新方法。一种基于 Count-Min 素描(CMS),另一种基于具有随机偏差的高斯过程先验。这些方法面向最通用的预测问题,即无法为数据流构建有用的真实模型。在统计语境中,这通常被称为 -开放问题类。在假设数据来自固定分布函数 的独立同分布样本的条件下,我们证明了基于 CMS 的分布函数估计是一致的。我们将新方法与两种已建立的预测器在累积 误差方面进行了比较。一种基于正态专家设定下的 Shtarkov 解(常称为归一化最大似然),另一种基于狄利克雷过程先验。这些比较针对两种情况展开。第一种是单次遍历,即利用 CMS 是素描这一事实来更新预测器。对于非单次遍历的预测器,我们使用流式 -均值来提供一个固定大小的代表性子集,以便在数据累积时进行更新。初步计算工作表明,对于足够复杂的数据,CMS 方法的单次遍历中位数版本很少被其他方法超越。我们还发现,基于具有随机偏差的高斯过程先验的预测器表现良好。此处使用的 Shtarkov 预测器表现不佳,可能是因为我们仅使用了最简单的例子。其他预测器在数据不像是来自 M-开放数据生成器时表现良好。
引用
@article{arxiv.2408.01318,
title = {Point Prediction for Streaming Data},
author = {Aleena Chanda and N. V. Vinodchandran and Bertrand Clarke},
journal= {arXiv preprint arXiv:2408.01318},
year = {2024}
}
备注
42 pages, two figures