超越准确率:大型真实世界临床文本数据集的自动去标识化
计算与语言
2023-12-15 v1 密码学与安全
机器学习
摘要
最近的研究进展在研究数据集上对自由文本临床笔记进行去标识化时达到了人类水平的准确率,但在大型真实世界环境中重现这一成果仍存在差距。本文总结了构建一个用于以完全自动化的方式对超过十亿份真实临床笔记进行去标识化的系统所获得的经验教训,该系统已通过多个组织的独立认证以供生产使用。完全自动化的解决方案需要非常高的准确率,且不需要人工审查。文中描述了一种基于上下文的混合模型架构,它在 i2b2-2014 基准测试上比仅使用命名实体识别(NER)的模型高出 10%。所提出的系统产生的错误分别比可比的 AWS、Azure 和 GCP 服务少 50%、475% 和 575%,同时性能也优于 ChatGPT 33%。它在不需微调的情况下,在 7 种欧洲语言中实现了超过 98% 的敏感数据覆盖率。描述的第二组模型支持数据混淆——用随机替代数据替换敏感数据——同时保持姓名、日期、性别、临床和格式的一致性。文中还描述了提供可靠且关联的匿名文档的实际需求和解决方案架构。
引用
@article{arxiv.2312.08495,
title = {Beyond Accuracy: Automated De-Identification of Large Real-World Clinical Text Datasets},
author = {Veysel Kocaman and Hasham Ul Haq and David Talby},
journal= {arXiv preprint arXiv:2312.08495},
year = {2023}
}
备注
Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2023, December 10th, 2023, New Orleans, United States, 13 pages