CTLformer:一种结合卷积层和自注意力机制的混合去噪模型用于提升 CT 图像重建
图像与视频处理
2025-05-20 v1 计算机视觉与模式识别
摘要
低剂量 CT (LDCT) 图像常伴随显著噪声,影响图像质量及后续诊断准确性。为解决多尺度特征融合和多样化噪声分布模式在 LDCT 去噪中的挑战,本文提出一种创新模型 CTLformer,将卷积结构与 transformer 架构相结合。提出两种关键创新:多尺度注意力机制和动态注意力控制机制。多尺度注意力机制通过 Token2Token 机制和自注意力交互模块实现,有效捕获不同尺度下的细节与全局结构,增强相关特征并抑制噪声。动态注意力控制机制根据输入图像的噪声特征调整注意力分布,在关注高噪声区域的同时保留低噪声区域的细节,从而提高鲁棒性并改善去噪性能。此外,CTLformer 集成卷积层进行高效特征提取,并采用重叠推理缓解边界伪影,进一步强化去噪能力。在 2016 年国家卫生研究院 AAPM Mayo Clinic LDCT 挑战数据集上进行实验,结果表明 CTLformer 在去噪性能和模型效率方面均显著优于现有方法,大幅提升 LDCT 图像质量。该方法不仅为 LDCT 去噪提供了高效解决方案,也在医学图像分析中展现广阔潜力,尤其适用于处理复杂噪声模式的临床应用。
关键词
引用
@article{arxiv.2505.12203,
title = {CTLformer: A Hybrid Denoising Model Combining Convolutional Layers and Self-Attention for Enhanced CT Image Reconstruction},
author = {Zhiting Zheng and Shuqi Wu and Wen Ding},
journal= {arXiv preprint arXiv:2505.12203},
year = {2025}
}