中文

DinTucker:将高斯过程模型扩展至含数十亿元素的多维数组

机器学习 2014-02-04 v5 分布式、并行与集群计算 机器学习

摘要

无限 Tucker 分解 (InfTucker) 和随机函数先验模型,作为无限可交换数组上的非参数贝叶斯模型,比广泛使用的 Tucker 和 PARAFAC 分解等多线性因子分解方法更强大,(部分)原因在于它们能够对数组元素间的非线性关系建模。尽管它们具有出色的预测性能和坚实的理论基础,但由于训练时间过长,无法处理海量数据。为克服这一局限,我们提出了分布式无限 Tucker (DINTUCKER),一种基于 MAPREDUCE 的大规模非线性张量分解算法。它在保持 InfTucker 预测精度的同时,可扩展至海量数据。DINTUCKER 基于一种新的分层贝叶斯模型,该模型允许在子数组上局部训练 InfTucker,并整合所有局部训练结果的信息。我们使用分布式随机梯度下降,结合变分推断,来训练此模型。我们将 DINTUCKER 应用于“阅读网络”项目 (Carlson 等人, 2010) 和信息安全领域中含数十亿元素的多维数组,并将其与最先进的大规模张量分解方法 GigaTensor 进行比较。在两个数据集上,DINTUCKER 均以更少的计算时间实现了显著更高的预测精度。

关键词

引用

@article{arxiv.1311.2663,
  title  = {DinTucker: Scaling up Gaussian process models on multidimensional arrays with billions of elements},
  author = {Shandian Zhe and Yuan Qi and Youngja Park and Ian Molloy and Suresh Chari},
  journal= {arXiv preprint arXiv:1311.2663},
  year   = {2014}
}