基于多视图卷积与描述正则化标签依赖注意力的医疗编码预测
计算与语言
2018-11-06 v1 人工智能
摘要
处理电子医疗数据中的一项普遍任务是为自由文本文档(如医疗报告)分配代表诊断和/或操作的标准化编码。这是一项困难的自然语言处理任务,需要解析冗长、异构的文档,并从数万种可能性中选出一组适当编码——其中许多只有极少正训练样本。我们提出了一个深度学习系统,在MIMIC-III数据集上推进了当前最优水平,取得了55.85%的微F1度量新最佳值,显著优于先前最佳结果(Mullenbach et al. 2018)。我们通过若干改进实现了这一点,包括两个主要新颖贡献:多视图卷积通道,有效学习在整个输入中调整核大小;以及由自然语言编码描述中介的注意力正则化,有助于克服数千个不常见编码的稀疏性。这些及其他修改被选定用于解决自动化编码特有以及深度学习普遍存在的困难。最后,我们详细考察准确率结果以单独度量这些贡献的影响,并指出未来算法改进的方向。
引用
@article{arxiv.1811.01468,
title = {Medical code prediction with multi-view convolution and description-regularized label-dependent attention},
author = {Najmeh Sadoughi and Greg P. Finley and James Fone and Vignesh Murali and Maxim Korenevski and Slava Baryshnikov and Nico Axtmann and Mark Miller and David Suendermann-Oeft},
journal= {arXiv preprint arXiv:1811.01468},
year = {2018}
}