RetSeg:基于保留机制的结直肠息肉分割网络
图像与视频处理
2024-03-11 v5 计算机视觉与模式识别
机器学习
摘要
视觉 Transformer(ViT)已革新医学影像分析,在息肉分类、检测与分割等关键任务中展现出优于传统卷积神经网络(CNN)的功效。ViT 利用注意力机制聚焦特定图像区域,在处理视觉数据时表现出上下文感知能力,即便对复杂医学图像也能得出稳健而精准的预测。此外,Transformer 固有的自注意力机制可适应不同输入尺寸与分辨率,赋予传统 CNN 所缺乏的空前灵活性。然而,由于自注意力,Transformer 面临内存占用过高与训练并行性受限等挑战,使其在资源受限设备上的实时疾病检测中不切实际。在本研究中,我们通过探究将新近提出的保留(retention)机制整合进息肉分割来解决这些障碍,引入 RetSeg,一种具有多头保留块编码-解码网络。受保留网络(RetNet)启发,RetSeg 旨在弥合精准息肉分割与资源利用间的差距,特别为结肠镜图像量身定制。我们采用两个公开数据集 Kvasir-SEG 与 CVC-ClinicDB 对 RetSeg 进行训练与验证以用于息肉分割。此外,我们在包括 CVC-ColonDB、ETIS-LaribPolypDB、CVC-300 与 BKAI-IGH NeoPolyp 在内的多样公开数据集上展示了 RetSeg 的 promising 性能。尽管我们的工作属早期探索,仍需进一步深入研究以推进这些可喜发现。
引用
@article{arxiv.2310.05446,
title = {RetSeg: Retention-based Colorectal Polyps Segmentation Network},
author = {Khaled ELKarazle and Valliappan Raman and Caslon Chua and Patrick Then},
journal= {arXiv preprint arXiv:2310.05446},
year = {2024}
}
备注
Updated PDF