面向自由文本健康记录去标识化的现代命名实体识别技术基准评测
计算与语言
2021-03-26 v1
摘要
电子健康记录(EHRs)已成为美国医疗数据保存的主要形式。联邦法律限制任何包含受保护健康信息(PHI)的 EHR 数据的共享。去标识化,即识别并移除所有 PHI 的过程,对于使 EHR 数据可公开用于科学研究至关重要。本项目探索了若干基于深度学习的命名实体识别(NER)方法,以确定哪些方法在去标识化任务上表现更优。我们在 i2b2 训练数据集上训练和测试了模型,并使用从本地医院收集的 EHR 数据对其性能进行了定性评估。我们发现:1)BiLSTM-CRF 代表了性能最佳的编码器/解码器组合;2)字符嵌入和 CRF 往往以召回率为代价提高精确率;3)单独的 transformers 作为上下文编码器表现不佳。未来聚焦于医疗文本结构化的工作可能改善 EHR 去标识化的语义和句法信息抽取。
引用
@article{arxiv.2103.13546,
title = {Benchmarking Modern Named Entity Recognition Techniques for Free-text Health Record De-identification},
author = {Abdullah Ahmed and Adeel Abbasi and Carsten Eickhoff},
journal= {arXiv preprint arXiv:2103.13546},
year = {2021}
}
备注
Presented at AMIA Informatics Summit 2021