Pyclipse:一个用于自由文本临床笔记去标识化的库
计算与语言
2023-11-07 v1
摘要
由于人工去标识化成本高昂,自动化临床文本数据去标识化至关重要,这一成本一直是共享临床文本和发展临床自然语言处理的障碍。然而,创建有效的自动化去标识化工具面临若干挑战,包括因文本处理、评估方法的差异以及临床领域和机构间缺乏一致性而导致的可重复性问题。为应对这些挑战,我们提出 pyclipse 框架,一种统一且可配置的评估流程,以简化去标识化算法的比较。Pyclipse 作为在本地临床数据上运行开源去标识化算法的单一接口,支持针对具体情境的评估。为展示 pyclipse 的效用,我们在四个公开和两个私有临床文本数据集上比较了六种去标识化算法。我们发现,即使在相同基准数据集上评估,算法性能也始终低于原论文所报告的结果。这些差异凸显了准确评估和比较去标识化算法的复杂性,强调了诸如 pyclipse 这样可重复、可调整和可扩展框架的必要性。我们的框架为评估和改进去标识化工具的统一方法奠定了基础,最终加强临床自然语言处理中的患者保护。
引用
@article{arxiv.2311.02748,
title = {Pyclipse, a library for deidentification of free-text clinical notes},
author = {Callandra Moore and Jonathan Ranisau and Walter Nelson and Jeremy Petch and Alistair Johnson},
journal= {arXiv preprint arXiv:2311.02748},
year = {2023}
}