从医疗记录文本到主题:一种无监督图划分方法
计算与语言
2018-07-10 v1 信息检索
机器学习
社会与信息网络
谱理论
摘要
电子医疗记录包含大量非结构化数据,包括广泛的自由文本。然而,由于缺乏及时提取可解释内容的方法论,这一详细信息的来源常常未被充分利用。在此,我们应用网络理论工具分析来自国家医疗服务体系的医院患者事件报告中的自由文本,以无监督方式在不同分辨率下寻找具有相似内容的文档簇。我们将深度神经网络段落向量文本嵌入与应用于文档向量稀疏化相似图的多尺度 Markov 稳定性社区检测相结合,并在伦敦帝国学院医疗 NHS 信托的事件报告上展示了该方法。多尺度社区结构揭示了数据集中主题的不同层次含义,这由从记录簇中提取的描述性术语所展示。我们还与医疗人员手工编码的类别进行后验比较,表明我们的方法优于基于 LDA 的模型。我们的内容簇与两个层次的手工编码类别表现出良好对应,但它们在某些区域提供了进一步的医学细节,并揭示了超越外部分类法的事件补充描述符。
引用
@article{arxiv.1807.02599,
title = {From Text to Topics in Healthcare Records: An Unsupervised Graph Partitioning Methodology},
author = {M. Tarik Altuncu and Erik Mayer and Sophia N. Yaliraki and Mauricio Barahona},
journal= {arXiv preprint arXiv:1807.02599},
year = {2018}
}