中文

StreaMRAK:一种流式多分辨率自适应核算法

机器学习 2021-09-09 v2 数值分析 数值分析 机器学习

摘要

核岭回归(KRR)是一种流行的非线性非参数学习方法。然而,现有的 KRR 实现要求将所有数据存储在主内存中,这严重限制了 KRR 在数据大小远超内存容量场景下的应用。此类应用在数据挖掘、生物信息学和控制领域日益普遍。针对因过大而无法放入内存的数据集,一种强大的计算范式是流式计算模型,即一次处理一个数据样本,并在处理下一个样本前丢弃当前样本。本文提出了 StreaMRAK——一种流式版本的 KRR。StreaMRAK 通过将问题划分为多个分辨率级别来改进现有 KRR 方案,从而允许对预测进行持续细化。该算法通过持续且高效地将新样本集成到训练模型中,降低了内存需求。借助一种新颖的子采样方案,StreaMRAK 通过创建原始数据的概要(sketch)来降低内存和计算复杂度,其中子采样密度根据核的带宽和数据的局部维度进行自适应调整。我们在两个合成问题以及双摆轨迹预测上进行了展示性研究。结果表明,所提出的算法快速且准确。

关键词

引用

@article{arxiv.2108.10411,
  title  = {StreaMRAK a Streaming Multi-Resolution Adaptive Kernel Algorithm},
  author = {Andreas Oslandsbotn and Zeljko Kereta and Valeriya Naumova and Yoav Freund and Alexander Cloninger},
  journal= {arXiv preprint arXiv:2108.10411},
  year   = {2021}
}