中文

直接从 k 空间进行 MRI 分类的高效复值 Vision Transformer

计算机视觉与模式识别 2026-01-27 v1

摘要

磁共振成像(MRI)中的深度学习应用主要在重建的幅值图像上进行操作,这一过程丢弃了相位信息并需要计算成本高昂的变换。标准神经网络架构依赖于局部操作(卷积或网格分块),这不适合原始频域(k 空间)数据的全局、非局部性质。在这项工作中,我们提出了一种新颖的复值 Vision Transformer (kViT),旨在直接对 k 空间数据进行分类。为了弥合当前架构与 MRI 物理之间的几何脱节,我们引入了一种尊重频域能量分布的径向 k 空间分块策略。在 fastMRI 和内部数据集上的大量实验表明,我们的方法实现了与最先进的图像域基线(ResNet、EfficientNet、ViT)相媲美的分类性能。至关重要的是,kViT 对高加速因子表现出卓越的鲁棒性,并在计算效率上提供了范式转变,与标准方法相比,在训练期间将 VRAM 消耗减少了高达 68×\times。这为资源高效的、直接来自扫描仪的 AI 分析确立了途径。

关键词

引用

@article{arxiv.2601.18392,
  title  = {Efficient Complex-Valued Vision Transformers for MRI Classification Directly from k-Space},
  author = {Moritz Rempe and Lukas T. Rotkopf and Marco Schlimbach and Helmut Becker and Fabian Hörst and Johannes Haubold and Philipp Dammann and Kevin Kröninger and Jens Kleesiek},
  journal= {arXiv preprint arXiv:2601.18392},
  year   = {2026}
}