分布式灵活非线性张量分解
机器学习
2016-05-24 v2 人工智能
分布式、并行与集群计算
机器学习
摘要
张量分解是分析多路数据的有力工具。与传统的多线性方法相比,非线性张量分解模型能够捕捉数据中更复杂的关系。然而,它们的计算成本高昂,且在数据极度稀疏的情况下可能遭受严重的学习偏差。为克服这些局限性,本文提出了一种分布式、灵活的非线性张量分解模型。我们的模型能有效避免现有 TGP 公式中 Kronecker 积带来的昂贵计算和结构限制,允许选择任意张量条目子集参与训练。同时,我们推导出了一个可处理且紧致的变分证据下界(ELBO),实现了高度解耦的并行计算和高质量推断。基于该新界,我们在 MapReduce 框架下开发了一种分布式推断算法,该算法无需键值对,并能充分利用 SPARK 等快速 MapReduce 系统中的内存缓存机制。实验结果充分展示了我们的方法在预测性能和计算效率方面优于几种最先进的方法。此外,我们的方法在在线广告的点击率(CTR)预测应用中显示出巨大的潜力。
引用
@article{arxiv.1604.07928,
title = {Distributed Flexible Nonlinear Tensor Factorization},
author = {Shandian Zhe and Kai Zhang and Pengyuan Wang and Kuang-chih Lee and Zenglin Xu and Yuan Qi and Zoubin Ghahramani},
journal= {arXiv preprint arXiv:1604.07928},
year = {2016}
}
备注
Gaussian process, tensor factorization, multidimensional arrays, large scale, spark, map-reduce