利用自然语言处理对具有网络风险的临床笔记进行分类
计算与语言
2022-03-25 v1 计算机与社会
摘要
临床笔记可嵌入电子病历中,记录患者诊疗过程并总结医疗提供者与患者之间的交互。这些临床笔记直接为患者的诊疗提供信息,也可间接为研究及质量/安全指标等诸多间接指标提供信息。近来,美国一些州要求患者开放访问其临床笔记,以改善患者诊疗中的患者信息交换。因此,在共享和交换数据之前开发评估临床笔记网络风险的方法至关重要。尽管现有自然语言处理技术旨在对临床笔记进行去标识化,但据我们所知,极少有研究关注敏感信息风险的分类,而这是实现有效、广泛保护患者健康信息的基础步骤。为弥补这一缺口,本研究探讨了识别临床笔记中安全/隐私风险的方法。该分类既可用于上游以识别笔记中可能包含敏感信息的区域,也可用于下游以改进对未完全去标识化临床笔记的识别。我们利用unigram与word2vec特征结合不同分类器开发了若干模型来对句子风险进行分类。在i2b2去标识化数据集上的实验表明,使用word2vec特征的SVM分类器取得了0.792的最大F1分数。未来研究涉及针对不同全球监管要求阐述并区分风险。
引用
@article{arxiv.2203.12781,
title = {Classifying Cyber-Risky Clinical Notes by Employing Natural Language Processing},
author = {Suzanna Schmeelk and Martins Samuel Dogo and Yifan Peng and Braja Gopal Patra},
journal= {arXiv preprint arXiv:2203.12781},
year = {2022}
}
备注
7 pages, 4 figures, published in Proceedings of the 55th Hawaii International Conference on System Sciences