SPARTan:面向大规模稀疏数据的可扩展 PARAFAC2
机器学习
2017-03-14 v1 数值分析
摘要
在探索性张量挖掘中,一个常见问题是如何分析一组主体(其观测自然不对齐)上的若干变量。例如,当对一组患者的医疗特征建模时,治疗的数量和持续时间可能随时间大不相同,这意味着没有有意义的方法能跨时间点对齐他们的临床记录以进行分析。为处理此类数据,最先进(state-of-the-art)的张量模型是所谓的 PARAFAC2,其产生可解释且鲁棒的输出,并能自然处理稀疏数据。然而,其迄今的主要局限在于缺乏能处理大规模数据集的高效算法。在本工作中,我们通过开发一种可扩展方法来计算大规模稀疏数据集的 PARAFAC2 分解,称为 SPARTan,从而填补了这一空白。我们的方法利用 PARAFAC2 内部的特殊结构,带来了一种新颖的算法重构,其既快速(绝对时间上)又比先前工作更节省内存。我们在合成和真实数据集上评估 SPARTan,显示出相较最佳先前实现 22 倍的性能提升,并且还能处理基线失败的大型问题实例。此外,我们能够将 SPARTan 应用于从真实且医疗复杂的儿科患者数据中进行时间演化表型挖掘。此过程中识别出的表型的临床意义,以及其在若干患者随时间的演化,已得到临床专家的认可。
引用
@article{arxiv.1703.04219,
title = {SPARTan: Scalable PARAFAC2 for Large & Sparse Data},
author = {Ioakeim Perros and Evangelos E. Papalexakis and Fei Wang and Richard Vuduc and Elizabeth Searles and Michael Thompson and Jimeng Sun},
journal= {arXiv preprint arXiv:1703.04219},
year = {2017}
}