中文

通过大规模训练与云端供应商方法对比基准,提高放射科报告去标识化性能

计算与语言 2025-11-24 v2

摘要

目标:通过扩展变 transformer 模型的训练数据规模并对比商业云端供应商系统的受保护健康信息(PHI)检测性能,来提高放射科报告自动去标识化的性能。材料与方法:在本回顾性研究中,我们在两个大型标注的放射科语料库(来自斯坦福大学,涵盖胸部X光、胸部CT、腹盆CT和脑部MRI报告)上对基于 transformer 的 PHI 去标识化管道进行微调,并引入额外的 PHI 类别(AGE)。模型在来自斯坦福大学和宾夕法尼亚大学(Penn)的测试集上对标记级 PHI 检测进行评估。我们进一步评估了(1)使用“隐藏在视线之中”方法生成的合成 PHI 的稳定性,以及(2)对商业系统的性能。计算了精确率、召回率和 F1 分数。结果:我们的模型在Penn数据集上实现了0.973的整体F1分数,在斯坦福数据集上实现了0.996的整体F1分数,优于或保持了之前的最先进模型性能。合成 PHI 评估显示,在50个独立去标识化的Penn数据集中,整体F1分数为0.959(置信区间0.958-0.960),检测性一致。我们的模型在合成Penn报告中击败了所有供应商系统(整体F1:0.960 vs. 0.632-0.754)。讨论:大规模、多模态训练提高了跨机构的泛化能力和鲁棒性。合成 PHI 生成在保持数据实用性的同时确保了隐私。结论:一个基于 transformer 的去标识化模型在多样化的放射科数据集上训练,可优于先前的学术和商业系统,在 PHI 检测方面表现出色,为安全的临床文本处理树立了新的基准。

关键词

引用

@article{arxiv.2511.04079,
  title  = {Improving the Performance of Radiology Report De-identification with Large-Scale Training and Benchmarking Against Cloud Vendor Methods},
  author = {Eva Prakash and Maayane Attias and Pierre Chambon and Justin Xu and Steven Truong and Jean-Benoit Delbrouck and Tessa Cook and Curtis Langlotz},
  journal= {arXiv preprint arXiv:2511.04079},
  year   = {2025}
}

备注

In submission to JAMIA