中文

面向可扩展、不确定性感知的 DICOM 去识别——基于混合 AI 与规则方法的框架

机器学习 2025-08-01 v1 机器学习

摘要

医学成像及其关联文本数据的获取有望推动医疗研究和患者结果的重大进步。然而,DICOM 文件中存在的受保护健康信息 (PHI) 和个人可识别信息 (PII) 构成了伦理和安全共享影像数据集的重大障碍。本文提出了由 Impact Business Information Solutions (IBIS) 开发的混合去识别框架,结合规则方法和 AI 方法,以及严格的不确定性量化,实现对 metadata 和像素数据的全面 PHI/PII 移除。我们的方案首先采用两级规则方法针对显式和推断的 metadata 元素进行处理,进一步增强由大型语言模型 (LLM) 微调的命名实体识别 (NER) 模型,训练数据来自模拟真实临床 PHI/PII 的合成数据集。对于像素数据,我们采用不确定性感知的 Faster R-CNN 模型定位嵌入文本,利用光学字符识别 (OCR) 提取候选 PHI,最终通过 NER 流水线完成去识别。关键在于不确定性量化为 AI 基于检测提供置信度度量,以增强自动化可靠性并支持人类在环验证以管理残余风险。该不确定性感知去识别框架在基准数据集和监管标准上表现稳健,包括 DICOM、HIPAA 和 TCIA 合规指标。通过结合可扩展自动化、不确定性量化和严格的质量保证,我们的解决方案解决了医学数据去识别的关键挑战,支持医疗影像数据得以安全、伦理且可信地发布用于研究。

关键词

引用

@article{arxiv.2507.23736,
  title  = {DICOM De-Identification via Hybrid AI and Rule-Based Framework for Scalable, Uncertainty-Aware Redaction},
  author = {Kyle Naddeo and Nikolas Koutsoubis and Rahul Krish and Ghulam Rasool and Nidhal Bouaynaya and Tony OSullivan and Raj Krish},
  journal= {arXiv preprint arXiv:2507.23736},
  year   = {2025}
}

备注

15 pages, 6 figures,