利用带标题章节内容训练模型从临床笔记中提取治疗计划
计算与语言
2019-07-01 v1
摘要
目的:使用自然语言处理(NLP)在临床笔记中找出陈述治疗计划的句子,可实现计划提取自动化,并进一步使其用于帮助提供者与护理管理者的工具中。然而,如同大多数临床文本上的NLP任务,创建用于训练和测试NLP模型的金标准繁琐且昂贵。幸运的是,临床笔记有时(但并非总是)包含以标题标识为计划的章节。利用此类带标签章节的内容作为含噪训练数据,我们评估了用该数据训练的NLP模型的准确性。方法:我们使用计划标题的常见变体及基于规则的启发式方法在临床笔记中查找带标题的计划章节,从中提取句子并形成含噪的计划句子训练数据。我们用该数据训练了支持向量机(SVM)与卷积神经网络(CNN)模型。我们通过十折交叉验证在含噪数据集上、以及在独立留出的手动标注数据集上分别测量训练模型的准确性。结果:在经IRB批准从克利夫兰诊所获取的1001份纵向患者记录中,117,730份临床笔记约13%含有可识别标题的治疗计划章节。我们从中提取并创建了13,492句计划句子的含噪训练数据。CNN取得了最佳F值,在交叉验证与留出评估实验中分别为0.91和0.97。SVM略逊,同实验中F值为0.89和0.96。结论:我们的研究表明,使用含噪计划句子训练监督学习模型可有效在所有临床笔记中识别它们。更广泛地,临床笔记中含非正式标题的章节可作为生成有效训练数据的良好来源。
引用
@article{arxiv.1906.11930,
title = {Training Models to Extract Treatment Plans from Clinical Notes Using Contents of Sections with Headings},
author = {Ananya Poddar and Bharath Dandala and Murthy Devarakonda},
journal= {arXiv preprint arXiv:1906.11930},
year = {2019}
}
备注
15 pages, 4 Figures, and 4 Tables