中文

FEFormer:用于三维医学图像分割中通用知识提取与自适应特征融合的频率增强视觉Transformer

图像与视频处理 2026-05-13 v1

摘要

医学图像中器官和病灶的精确分割对于诊断、预后和治疗计划等临床应用至关重要。虽然视觉Transformer(ViT)已展现出令人印象深刻的分割性能,但它们在模块和架构设计上面临关键挑战。具体来说,自注意力机制难以捕获对理解详细解剖结构至关重要的细粒度局部特征;标准的MLP模块缺乏保留空间信息的显式机制;传统的编码器-解码器架构依赖于朴素的朴素特征融合策略,无法处理巨大的语义差异;并且现有设计缺乏将低级信息从编码器传播到解码器的显式机制。为解决这些局限性,我们提出了一种用于鲁棒且高效的体积医学图像分割的频率增强视觉Transformer(FEFormer),它显式地对频率信息进行建模,以联合捕获全局上下文和精细的结构细节。FEFormer包含四个新颖的组件:一个频率增强动态自注意力(FDSA)模块,通过保留局部性的卷积与频域注意力机制,联合捕获细粒度局部细节和全局长程依赖关系;一个频率分解门控MLP(FGMLP),自适应地对低频和高频分量进行建模,以增强语义和结构表示;一个小波引导的自适应特征融合(WAFF)模块,在频域中实现语义一致的编码器-解码器特征集成;以及一个频率启用的跨尺度主干桥接(FCSB),增强跨尺度的低级特征传播。在四个不同的体积医学图像分割任务上评估,FEFormer在实现优越分割性能的同时,相比最先进的方法具有高计算效率。

关键词

引用

@article{arxiv.2605.11434,
  title  = {FEFormer: Frequency-enhanced Vision Transformer for Generic Knowledge Extraction and Adaptive Feature Fusion in Volumetric Medical Image Segmentation},
  author = {Jin Yang and Xiaobing Yu and Peijie Qiu},
  journal= {arXiv preprint arXiv:2605.11434},
  year   = {2026}
}

备注

20 pages, 8 figures, 9 tables