利用扩散自编码器嵌入发现 MRI 数据中不可预见的数据属性
计算机视觉与模式识别
2024-10-15 v1
摘要
深度学习在医学影像领域取得显著进展,依赖大规模数据集以提升诊断与预后水平。但大规模数据集常伴随通过学科选择与获取方式引入的固有误差。本文探讨利用扩散自编码器 (DAE) 嵌入来识别与理解数据特征与偏好,包括针对受保护变量(如性别)的偏好以及数据异常指示不寻常获取方案变异的证据。我们采用来自德国国家队列 (NAKO) 参与者的 11186 例脊椎 MRI 图像(包括腰部、胸部与腰椎区域的侧位 T2 加权磁共振影像)。我们将 DAE 嵌入与现有生成模型如 StyleGAN 与变分自编码器进行比较。针对由脊椎三个区域的侧位 T2 加权 MR 影像构成的大规模数据集进行评估,结果表明 DAE 嵌入能够有效分离受保护变量如性别与年龄。此外,我们使用 t-SNE 可视化识别不寻常的获取方案差异,揭示头部定位的差异。我们的嵌入可识别性别预测器在学习正确性别时会遇到问题的样本。我们的发现凸显了利用如 DAE 等先进嵌入技术来检测医学影像数据集中的数据质量问题与偏好潜在关系的潜力。识别此类隐藏关系可提升医疗保健深度学习模型的可靠性与公平性,最终改善患者护理与结果。
引用
@article{arxiv.2410.10220,
title = {Detecting Unforeseen Data Properties with Diffusion Autoencoder Embeddings using Spine MRI data},
author = {Robert Graf and Florian Hunecke and Soeren Pohl and Matan Atad and Hendrik Moeller and Sophie Starck and Thomas Kroencke and Stefanie Bette and Fabian Bamberg and Tobias Pischon and Thoralf Niendorf and Carsten Schmidt and Johannes C. Paetzold and Daniel Rueckert and Jan S Kirschke},
journal= {arXiv preprint arXiv:2410.10220},
year = {2024}
}
备注
This paper was accepted in the "Workshop on Interpretability of Machine Intelligence in Medical Image Computing" (iMIMIC) at MICCAI 2024