通过无监督基于图的聚类从自由文本中提取信息:在患者事件记录中的应用
机器学习
2019-09-04 v1 计算与语言
信息检索
谱理论
机器学习
摘要
电子健康记录中大量的文本常因缺乏提取可解释内容的方法而未被充分利用。在此我们提出一种无监督自由文本分析框架,其结合了段落向量的文本嵌入与图论多尺度社区发现。我们分析了来自英格兰国民健康服务体系的患者事件报告语料库,以无监督方式在不同分辨率下发现基于内容的报告聚类。我们的无监督方法提取出具有高度内在文本一致性的群组,并与医护人员手工编码的类别表现相当。我们还展示了如何利用这种内容驱动的聚类来改进基于报告文本对事件伤害程度的有监督预测。最后,我们讨论了随时间监测报告以及检测既有类别之外新兴趋势的未来方向。
引用
@article{arxiv.1909.00183,
title = {Extracting information from free text through unsupervised graph-based clustering: an application to patient incident records},
author = {M. Tarik Altuncu and Eloise Sorin and Joshua D. Symons and Erik Mayer and Sophia N. Yaliraki and Francesca Toni and Mauricio Barahona},
journal= {arXiv preprint arXiv:1909.00183},
year = {2019}
}
备注
To appear as a book chapter