中文

临床记录的有效表示

机器学习 2018-08-20 v3 机器学习

摘要

临床记录是关于患者状态的丰富信息来源。然而,使用它们通过机器学习模型预测临床事件具有挑战性。它们维度极高、稀疏且结构复杂。此外,由于为许多临床事件获取可靠标签的成本高昂,训练数据通常稀缺。这些困难传统上通过编码特定任务领域知识的手工特征工程来解决。我们探索了使用神经网络和迁移学习来学习临床记录的表示,这些表示可用于预测未来感兴趣的临床事件,例如全因死亡率、住院和急诊就诊。我们的数据包含斯坦福医院270万条记录和11.5万名患者。我们将学习到的表示,连同常用的词袋模型和主题模型表示,作为临床事件预测模型的特征。我们评估了这些表示在小型数据集上训练模型性能方面的有效性。使用神经网络派生表示的模型在小型(N < 1000)训练数据集上的表现显著优于使用基线表示的模型。对于一系列预测建模任务和队列规模,学习到的表示相比常用的基线表示提供了显著的性能提升,在缺乏充足标记训练数据时,为特定任务的特征工程提供了有效替代方案。

关键词

引用

@article{arxiv.1705.07025,
  title  = {Effective Representations of Clinical Notes},
  author = {Sebastien Dubois and Nathanael Romano and David C. Kale and Nigam Shah and Kenneth Jung},
  journal= {arXiv preprint arXiv:1705.07025},
  year   = {2018}
}