半正交非负矩阵分解及其在文本挖掘中的应用
统计方法学
2019-07-05 v3 机器学习
机器学习
摘要
急诊科(ED)拥挤是一个影响医院管理效率与患者护理质量的全球性问题。当接收患者的入院病房床位请求在医生做出入院决定前被延误时,就会发生这种情况。为减少 ED 的过度拥挤与等待时间,我们利用分诊时收集的护士手写记录构建分类器以预测患者去向,从而使医院人员能提前开始必要准备。然而,这些分诊记录涉及高维、含噪且稀疏的文本数据,导致模型拟合与解释困难。为解决此问题,我们提出半正交非负矩阵分解(SONMF),适用于连续与二值设计矩阵,以首先将患者与词语双聚类为较少数量的主题。随后这些对象可解释为一组正交基主题向量的非负线性组合。这些生成的主题向量让医院直接理解入院原因。我们表明,通过使用基变换,与传统词袋模型及其他矩阵分解方法相比,分类精度可进一步提高。通过模拟数据实验,我们还证明所提方法在分解精度、收敛速率与正交程度方面优于其他非负矩阵分解(NMF)方法。
引用
@article{arxiv.1805.02306,
title = {Semi-orthogonal Non-negative Matrix Factorization with an Application in Text Mining},
author = {Jack Yutong Li and Ruoqing Zhu and Annie Qu and Han Ye and Zhankun Sun},
journal= {arXiv preprint arXiv:1805.02306},
year = {2019}
}