稀疏分层Tucker分解及其在医疗健康中的应用
机器学习
2016-10-26 v1 数值分析
摘要
我们提出一种新的张量分解方法,称为稀疏分层 Tucker(Sparse Hierarchical-Tucker,Sparse H-Tucker),用于稀疏高阶数据张量。Sparse H-Tucker 的灵感来源于其同名经典分层 Tucker 方法,该方法旨在计算输入数据集的树结构分解,以便领域专家易于解释。然而,Sparse H-Tucker 使用嵌套采样技术克服了分层 Tucker 中的一个关键可扩展性问题,即生成难以处理的中间稠密核张量;我们方法的结果是更快、更节省空间且更精确的方法。我们在真实的医疗健康数据集上广泛测试了该方法,该数据集来自 3 万名患者,生成一个 18 阶稀疏数据张量。与竞争方法不同,Sparse H-Tucker 可在单台多线程机器上分析完整数据集。它还能比最先进的方法更准确且更省时:在输入数据的 12 阶子集上,Sparse H-Tucker 的准确度提高 18 倍,速度加快 7.5 倍。即便对于分析低阶张量(例如 4 阶),与传统张量分解方法(如 CP 和 Tucker)相比,我们的方法所需时间近乎少一个数量级,内存少两个数量级以上。此外,我们观察到 Sparse H-Tucker 对非零张量元素数量近乎线性扩展。所得模型还提供了可解释的疾病层次结构,并得到了临床专家的确认。
引用
@article{arxiv.1610.07722,
title = {Sparse Hierarchical Tucker Factorization and its Application to Healthcare},
author = {Ioakeim Perros and Robert Chen and Richard Vuduc and Jimeng Sun},
journal= {arXiv preprint arXiv:1610.07722},
year = {2016}
}
备注
This is an extended version of a paper presented at the 15th IEEE International Conference on Data Mining (ICDM 2015)