基于分层标签注意力网络与标签嵌入初始化的临床笔记可解释自动编码
计算与语言
2021-07-20 v4 机器学习
摘要
临床笔记的诊断或操作编码旨在提取患者疾病相关信息的编码摘要。此类编码通常在医院中手动完成,但有可能实现自动化以提高医疗编码的效率和准确性。近期关于深度学习用于自动医疗编码的研究取得了有前景的性能。然而,这些模型的可解释性通常较差,阻碍了它们在支持临床实践中的可信应用。另一局限是这些模型大多假设标签间相互独立,忽略了医疗编码间可被利用以提升性能的复杂相关性。我们提出了一种分层标签注意力网络(HLAN),旨在通过量化与每个标签相关的词和句子的重要性(以注意力权重表示)来解释模型。其次,我们提出用标签嵌入(LE)初始化方法增强主流深度学习模型,该方法学习稠密连续向量表示,并将该表示注入模型的最终层和标签注意力层。我们使用 MIMIC-III 出院小结在三种设置下评估了这些方法:全编码、前50编码和英国 NHS COVID-19 防护编码。实验比较了 HLAN 和 LE 初始化与基于神经网络的最优(SOTA)方法。HLAN 在前50编码预测上取得了最佳的微观层级 AUC 和 ,在 NHS COVID-19 防护编码预测上与其他模型结果相当。通过高亮每个标签最显著的词和句子,HLAN 相比其弱化基线和基于 CNN 的模型展现出更有意义且更全面的模型解释。LE 初始化持续提升了大多数用于自动医疗编码的深度学习模型。
引用
@article{arxiv.2010.15728,
title = {Explainable Automated Coding of Clinical Notes using Hierarchical Label-wise Attention Networks and Label Embedding Initialisation},
author = {Hang Dong and Víctor Suárez-Paniagua and William Whiteley and Honghan Wu},
journal= {arXiv preprint arXiv:2010.15728},
year = {2021}
}
备注
Accepted to Journal of Biomedical Informatics, structured abstract in full text, 21 pages, 5 figures, 4 supplementary materials (4 extra pages)