用于临床数据仓库文档假名化的自然语言处理算法的开发与验证
计算与语言
2023-03-24 v1
摘要
本研究的目的是解决临床报告去标识化的关键问题,以便在保障患者隐私的同时允许出于研究目的访问数据。该研究强调了在该领域共享工具与资源所面临的困难,并介绍了巴黎公立医院集团(AP-HP)在其临床数据仓库中对文本文档实施系统化假名化的经验。我们根据 12 类识别实体标注了一个临床文档语料库,并构建了一个混合系统,融合深度学习模型与人工规则的结果。我们的结果显示 F1 分数总体性能为 0.99。我们讨论了实现方案的选择,并展示了为更好理解此类任务所需投入(包括数据集规模、文档类型、语言模型或规则添加)而进行的实验。我们以 3-Clause BSD 许可证共享指南与代码。
引用
@article{arxiv.2303.13451,
title = {Development and validation of a natural language processing algorithm to pseudonymize documents in the context of a clinical data warehouse},
author = {Xavier Tannier and Perceval Wajsbürt and Alice Calliger and Basile Dura and Alexandre Mouchet and Martin Hilka and Romain Bey},
journal= {arXiv preprint arXiv:2303.13451},
year = {2023}
}