中文

WiTUnet:集成 CNN 与 Transformer 的 U 型架构以改进特征对齐与局部信息融合

计算机视觉与模式识别 2024-04-30 v2 人工智能 机器学习

摘要

低剂量计算机断层扫描(LDCT)因其相较于标准 CT 辐射剂量更低,已成为诊断医学成像的首选技术,尽管这会增加图像噪声并可能影响诊断准确性。为解决这一问题,目前已开发出先进的基于深度学习的 LDCT 去噪算法,主要采用卷积神经网络(CNN)或具有 Unet 架构的 Transformer 网络。该架构通过跳跃连接整合来自编码器和解码器的特征图来增强图像细节。然而,当前方法往往忽略了对 Unet 架构本身的改进,而侧重于优化编码器和解码器结构。这种方法可能会带来问题,因为编码器和解码器之间的特征图特性存在显著差异,简单的融合策略可能无法有效重建图像。本文提出了 WiTUnet,一种新型 LDCT 图像去噪方法,该方法利用嵌套的密集跳跃路径代替传统跳跃连接以改善特征整合。WiTUnet 还引入了窗口化 Transformer 结构,以更小的非重叠片段处理图像,从而降低计算负载。此外,在编码器和解码器中均集成了局部图像感知增强(LiPe)模块,以替代 Transformer 中的标准多层感知机(MLP),增强了局部特征的捕获与表示。通过广泛的实验对比,WiTUnet 在峰值信噪比(PSNR)、结构相似性(SSIM)和均方根误差(RMSE)等关键指标上表现出优于现有方法的性能,显著改善了噪声去除和图像质量。

关键词

引用

@article{arxiv.2404.09533,
  title  = {WiTUnet: A U-Shaped Architecture Integrating CNN and Transformer for Improved Feature Alignment and Local Information Fusion},
  author = {Bin Wang and Fei Deng and Peifan Jiang and Shuang Wang and Xiao Han and Zhixuan Zhang},
  journal= {arXiv preprint arXiv:2404.09533},
  year   = {2024}
}