中文

医学图像中基于 AI 的像素级受保护健康信息检测系统设计探索

计算机视觉与模式识别 2025-06-26 v4

摘要

医学图像去标识化是确保在科研和临床环境中进行数据共享时保护隐私的关键步骤。该过程的初始步骤涉及检测受保护健康信息(PHI),这些信息可能存在于图像元数据中或以图案形式嵌入图像像素中。尽管此类系统的重要性不言而喻,但现有基于 AI 的解决方案进行评估仍有限,制约了可靠且稳健工具的开发。在本研究中,我们提出了用于 PHI 检测的基于 AI 的管道,包括三个关键模块:文本检测、文本提取和文本分析。我们对 YOLOv11、EasyOCR 和 GPT-4o 三个模型在不同设置下进行基准测试,这些设置对应上述三个模块,在两个包含多种成像模态和 PHI 类别的数据集上进行评估。我们的发现表明,最佳配置涉及为每个模块分别使用专用的视觉和语言模型,这在性能、延迟和大型语言模型(LLM)使用的成本之间取得了令人称赞的平衡。此外,我们展示了 LLM 的应用不仅涉及识别 PHI 内容,还增强了 OCR 任务,促进了端到端 PHI 检测管道的实现,展现出通过分析具有前景的成果。

关键词

引用

@article{arxiv.2501.09552,
  title  = {Exploring AI-based System Design for Pixel-level Protected Health Information Detection in Medical Images},
  author = {Tuan Truong and Ivo M. Baltruschat and Mark Klemens and Grit Werner and Matthias Lenga},
  journal= {arXiv preprint arXiv:2501.09552},
  year   = {2025}
}

备注

In progress