XNAT 生态系统中的图像去识别:应用场景与解决方案
摘要
XNAT 是一个基于服务器的数据管理平台,广泛用于学术界策划大型 DICOM 图像数据库以支持科研项目。我们详细描述了使用 XNAT facilities 进行 DICOM 数据去识别的工作流程,以及来自 XNAT "生态系统" 中独立工具的使用。我们列举了基于 prior 经验的不同去识别需求情境。Medical Image De-Identification Benchmark(MIDI-B)挑战的参赛起点是一套既有的本地方法,这些方法在挑战的验证阶段被调整以适应实际需求。我们在测试阶段的结果为 97.91%,显著低于同行水平,这主要源于我们方法与挑战 Synapse 平台之间隐蔽的技术不兼容性,导致我们无法在验证阶段收到反馈。在提交后,通过挑战组织者和 MIDI-B 持续基准设施提供的额外差异报告,我们显著提高了该分数至 99.61%。我们展示了完全基于规则的方法在测试语料中能够成功移除所有姓名相关信息,但在处理地址数据时存在局限。最初使用已发布机器学习模型处理地址的实验部分成功,但显示模型对其他类型的自由文本数据过于激进,导致整体性能略有下降至 99.54%。未来的开发将因此集中于改进地址识别能力,同时更好地移除烙印在图像像素中的可识别数据。针对挑战组织者仍在讨论的几个技术方面,我们估计目前在 MIDI-B 测试语料中真正的去识别失败率约为 0.19%。(已为 arXiv 提交版本所删减)
引用
@article{arxiv.2504.20657,
title = {Image deidentification in the XNAT ecosystem: use cases and solutions},
author = {Alex Michie and Simon J Doran},
journal= {arXiv preprint arXiv:2504.20657},
year = {2025}
}
备注
For submission to MELBA (Machine Learning for Biomedical Imaging) special issue on the MIDI-B deidentification challenge (https://www.synapse.org/Synapse:syn53065760). 11 pages, 1 fig, 2 tables; 1 supplementary data file (supplementary_tables_S1_S2_S3.xlsx) containing three spreadsheet tabs