中文

COPA:面向稀疏与大型数据集的约束化 PARAFAC2 方法

机器学习 2018-08-29 v2 机器学习

摘要

PARAFAC2 在建模不规则张量方面已展现出成功,这类张量的某一模态维度随样本变化。一个典型场景是对一组随就诊次数随时间变化的患者进行的治疗建模。尽管无约束 PARAFAC2 近期有所改进,但其模型因子通常稠密且对噪声敏感,限制了可解释性。因此,仍存在以下开放挑战:a) 需要施加时间平滑、稀疏性和非负性等多种建模约束,以实现可解释的时间建模;b) 需要一种可扩展的方法,以高效支持大型数据集上的这些约束。为应对这些挑战,我们提出一种约束化 PARAFAC2(COnstrained PArafac2, COPA)方法,该方法谨慎地将时间平滑、稀疏性和非负性等优化约束纳入所得因子中。为高效支持所有约束,COPA 采用交替优化与交替方向乘子法(AO-ADMM)的混合优化框架。在包含数十万患者的大型电子健康记录(EHR)数据集上的评估表明,COPA 相比先前仅尝试处理 COPA 所支持约束子集的 PARAFAC2 方法实现了显著加速(最高快 36 倍)。总体而言,我们的方法在速度上优于所有仅尝试处理部分约束的基线,同时达到同等精度。通过对医疗复杂儿童的时序表型分析案例研究,我们展示了 COPA 施加的约束如何揭示简洁的表型和有意义的患者的时序特征。表型与时序特征的临床解释已获医学专家确认。

关键词

引用

@article{arxiv.1803.04572,
  title  = {COPA: Constrained PARAFAC2 for Sparse & Large Datasets},
  author = {Ardavan Afshar and Ioakeim Perros and Evangelos E. Papalexakis and Elizabeth Searles and Joyce Ho and Jimeng Sun},
  journal= {arXiv preprint arXiv:1803.04572},
  year   = {2018}
}

备注

17 pages