神经网络临床去标识化系统的可迁移性
计算与语言
2021-08-18 v3 密码学与安全
机器学习
摘要
目的:神经网络去标识化研究多聚焦于单一数据集,这些研究假设有足量人工标注数据可用于训练能泛化到相应测试数据的模型。然而在真实场景中,研究者往往仅有有限甚至没有内部训练数据。现有系统与外部数据有助于在内部数据上启动去标识化工作;但利用现有系统与外部数据的最有效方式尚不明晰。本文研究了在针对领域泛化进行架构修改、以及针对领域迁移进行策略性训练时,最先进的神经临床去标识化系统 NeuroNER 在多种数据集上的可迁移性。方法与材料:我们使用来自两家机构的四个临床病历语料库(含多种病历类型),对 NeuroNER 的可迁移性进行了比较研究。我们从架构上修改 NeuroNER 以集成两类领域泛化方法,并采用三种训练策略评估每种架构。我们度量了:来自外部源的可迁移性;跨病历类型的可迁移性;在具备领域内训练数据时外部源数据的贡献;以及跨机构的可迁移性。结果与结论:单一外部源的可迁移性结果不一致。使用更多外部源稳定地取得了约 80% 的 F1 分数。微调成为一种主导的迁移策略,无论是否进行领域泛化。我们还发现,即便在具备领域内训练数据时,外部源依然有用。跨机构的可迁移性因病历类型和标注标签而异,但带来了性能提升。
引用
@article{arxiv.2102.08517,
title = {Transferability of Neural Network Clinical De-identification Systems},
author = {Kahyun Lee and Nicholas J. Dobbins and Bridget McInnes and Meliha Yetisgen and Ozlem Uzuner},
journal= {arXiv preprint arXiv:2102.08517},
year = {2021}
}