中文

当高斯过程遇见大数据:可扩展 GP 综述

机器学习 2019-04-10 v2 机器学习

摘要

大数据带来的海量信息以及不断演进的计算机硬件推动了机器学习领域的成功案例。与此同时,这对高斯过程(GP)回归这一著名的非参数可解释贝叶斯模型提出了挑战,因其对数据规模具有立方复杂度。为了在提升可扩展性的同时保持理想的预测质量,人们提出了多种可扩展 GP。但它们尚未被全面综述与分析,以便学术界与工业界充分理解。鉴于数据规模的爆发,GP 社区对可扩展 GP 的综述是及时且重要的。为此,本文致力于综述最先进的可扩展 GP,涉及两大类:提炼全部数据的全局近似,以及划分数据进行子空间学习的局部近似。特别地,对于全局近似,我们主要关注稀疏近似,包括修改先验但执行精确推断的先验近似、保留精确先验但执行近似推断的后验近似,以及利用核矩阵中特定结构的稀疏结构化近似;对于局部近似,我们强调通过多个局部专家进行模型平均以提升预测的专家混合/乘积。为呈现完整综述,本文还回顾了近期在提升可扩展 GP 的可扩展性与能力方面的进展。最后,回顾并讨论了可扩展 GP 在各种场景中实现的扩展与开放问题,以启发未来研究路径的新思路。

关键词

引用

@article{arxiv.1807.01065,
  title  = {When Gaussian Process Meets Big Data: A Review of Scalable GPs},
  author = {Haitao Liu and Yew-Soon Ong and Xiaobo Shen and Jianfei Cai},
  journal= {arXiv preprint arXiv:1807.01065},
  year   = {2019}
}

备注

20 pages, 6 figures