中文

DICOM系列分类中图像与元数据的集成再思考:跨注意力与字典学习

图像与视频处理 2026-05-22 v2 计算机视觉与模式识别

摘要

自动识别DICOM图像系列对于大规模医学图像分析、质量控制、协议一致性以及可靠的下游处理至关重要。然而,由于异构切片内容、可变的系列长度以及完全缺失、不完整或不一致的DICOM元数据,DICOM系列分类仍然具有挑战性。我们提出了一个用于DICOM系列分类的端到端多模态框架,联合建模图像内容和获取元数据,同时显式地处理所有这些挑战。(i)图像和元数据通过模态感知模块进行编码,并通过双向跨模态注意力机制进行融合。(ii)元数据通过基于可学习特征字典和价值条件调制的稀疏、缺失感知编码器进行处理。该方法设计上不需要任何形式的插值。(iii)通过在等距采样的切片上操作的2.5D视觉编码器和注意力机制处理系列长度和图像数据维度的可变性。我们在公开的Duke肝脏MRI数据集和大型多机构院内队列上评估了所提出的方法,评估了原领域性能和跨领域 generalization。在所有评估设置下,所提出的方法 consistently 超过了相关的仅图像、仅元数据和2D/3D多模态基线。结果表明,显式建模元数据的稀疏性和跨模态相互作用有助于提高DICOM系列分类的鲁棒性。

关键词

引用

@article{arxiv.2602.23833,
  title  = {Revisiting Integration of Image and Metadata for DICOM Series Classification: Cross-Attention and Dictionary Learning},
  author = {Tuan Truong and Melanie Dohmen and Sara Lorio and Matthias Lenga},
  journal= {arXiv preprint arXiv:2602.23833},
  year   = {2026}
}

备注

Early acceptance at MICCAI 2026