中文

MHITNet:一种用于分割医学 CT 图像的最小化分层上下文注意力滤波网络

图像与视频处理 2022-11-03 v1

摘要

在医学 CT 图像处理领域,卷积神经网络(CNNs)一直是主导技术。编码器-解码器 CNNs 利用局部性以提升效率,但无法恰当模拟远距离像素交互。近期研究表明,自注意力或 transformer 层可堆叠以高效学习长程依赖。通过将图像块构建并处理为嵌入,transformers 已应用于计算机视觉任务。然而,基于 transformer 的架构缺乏全局语义信息交互,且需要大规模训练数据集,使得用小样本训练颇具挑战。为解决这些挑战,我们提出了一种分层上下文注意力 transformer 网络(MHITNet),其在跳跃连接中结合了多尺度、transformer 与分层上下文提取模块。多尺度模块捕获更深的 CT 语义信息,使 transformers 能更有效地将来自不同 CNN 阶段的令牌化图像块特征图编码为输入注意力序列。分层上下文注意力模块增强全局数据并重新加权像素以捕获语义上下文。在三个数据集上的大量试验表明,所提出的 MHITNet 优于当前最佳实践。

关键词

引用

@article{arxiv.2211.00700,
  title  = {MHITNet: a minimize network with a hierarchical context-attentional filter for segmenting medical ct images},
  author = {Hongyang He and Feng Ziliang and Yuanhang Zheng and Shudong Huang and HaoBing Gao},
  journal= {arXiv preprint arXiv:2211.00700},
  year   = {2022}
}