中文

Polyp-PVT:基于金字塔视觉Transformer的息肉分割

图像与视频处理 2024-02-20 v8 计算机视觉与模式识别

摘要

大多数息肉分割方法使用CNN作为骨干网络,导致在编码器与解码器之间交换信息时出现两个关键问题:1) 考虑不同层级特征贡献的差异;2) 设计有效的机制来融合这些特征。与现有的基于CNN的方法不同,我们采用transformer编码器,其学习到更具鲁棒性和表达力的特征表示。此外,考虑到图像采集的影响以及息肉的隐匿特性,我们引入了三个标准模块,包括级联融合模块(CFM)、伪装识别模块(CIM)和相似度聚合模块(SAM)。其中,CFM用于从高阶特征中收集息肉的语义与位置信息;CIM用于捕获隐藏在低阶特征中的息肉信息;SAM将息肉区域的高阶语义位置信息扩展至整个息肉区域,从而有效融合跨层级特征。所提出的模型名为Polyp-PVT,有效抑制了特征中的噪声并显著提升了其特征表达能力。在五个广泛采用的数据集上的大量实验表明,相较于现有的代表性方法,所提模型对多种挑战性情形(如外观变化、小目标、旋转)更具鲁棒性。所提模型已开源:https://github.com/DengPingFan/Polyp-PVT。

关键词

引用

@article{arxiv.2108.06932,
  title  = {Polyp-PVT: Polyp Segmentation with Pyramid Vision Transformers},
  author = {Bo Dong and Wenhai Wang and Deng-Ping Fan and Jinpeng Li and Huazhu Fu and Ling Shao},
  journal= {arXiv preprint arXiv:2108.06932},
  year   = {2024}
}

备注

Accepted to CAAI AIR 2023