利用临床叙述与结构化数据识别乳腺癌远处复发
计算与语言
2018-06-18 v2
摘要
从电子健康记录(EHR)中准确识别乳腺癌远处复发对临床诊疗与二次分析均十分重要。尽管已开发多种用于乳腺癌计算表型的工具,远处复发的识别仍严重依赖人工阅图。本研究旨在利用EHR中的临床叙述与结构化数据,开发识别乳腺癌远处复发的模型。我们应用MetaMap从临床叙述中提取特征,并从EHR中检索结构化临床数据。利用这些特征,我们训练支持向量机模型以识别乳腺癌患者的远处复发。我们使用1,396名双标注受试者训练模型,并用599名双标注受试者验证模型。此外,我们以4,904名单标注受试者作为泛化测试集验证模型。在训练集的交叉验证中我们获得0.92(SD=0.01)的高曲线下面积(AUC)得分,随后在分别使用599和4,904个样本的留出测试与泛化测试中取得0.95和0.93的AUC得分。我们的模型通过结合从非结构化临床叙述与结构化临床数据中提取的特征,能够准确且高效地识别乳腺癌远处复发。
引用
@article{arxiv.1806.04818,
title = {Using Clinical Narratives and Structured Data to Identify Distant Recurrences in Breast Cancer},
author = {Zexian Zeng and Ankita Roy and Xiaoyu Li and Sasa Espino and Susan Clare and Seema Khan and Yuan Luo},
journal= {arXiv preprint arXiv:1806.04818},
year = {2018}
}