构建中文电子病历心血管疾病风险因素标注语料库
计算与语言
2017-03-06 v2
摘要
心血管疾病(CVD)已成为中国首要的死因,而大多数病例可以通过控制风险因素来预防。本研究旨在基于中文电子病历(CEMRs)构建一个 CVD 风险因素标注语料库。该语料库旨在用于开发风险因素信息抽取系统,进而作为进一步研究风险因素与 CVD 进展的基础。我们设计了一项轻量级标注任务,以捕获病历中显式或隐式展示的带有指标、时间属性和断言的 CVD 风险因素。该任务包括:1)准备数据;2)创建捕获标注的指南(这些指南在临床医生的帮助下创建);3)提出一种标注方法,包括构建指南草案、培训标注员和更新指南,以及语料库构建。随后,基于 600 名患者的去标识化出院小结和病程记录,开发了一个风险因素标注语料库。该语料库在临床医生的协助下构建,其标注者间一致性(IAA)F1 值为 0.968,表明具有很高的可靠性。据我们所知,这是首个关于 CEMRs 中 CVD 风险因素的标注语料库,并且提出了从 CEMRs 中捕获 CVD 风险因素标注的指南。所获得的文档级标注可用于未来的研究中,以长期监测风险因素和 CVD。
引用
@article{arxiv.1611.09020,
title = {Developing a cardiovascular disease risk factor annotated corpus of Chinese electronic medical records},
author = {Jia Su and Bin He and Yi Guan and Jingchi Jiang and Jinfeng Yang},
journal= {arXiv preprint arXiv:1611.09020},
year = {2017}
}
备注
32 pages, 3 figures, 3 tables