中文

面向高频信息增强的全息分割:全局-局部视觉转换器

计算机视觉与模式识别 2024-10-11 v2

摘要

众多研究表明,基于视觉转换器(ViT)的方法在计算机视觉任务中表现优异。然而,ViT 模型常常难以有效捕获图像中的高频成分,这些成分对于检测小目标和保留边缘细节尤为关键,尤其是在复杂场景下。这种限制在结肠息肉分割任务中尤为突出,因为息肉在结构、纹理和形状上存在显著差异。高频信息(如边界细节)对于实现该任务的精确语义分割至关重要。为此,我们提出 HiFiSeg,一款新的结肠息肉分割网络,通过全局-局部视觉转换器框架增强高频信息处理。HiFiSeg 采用金字塔视觉转换器(PVT)作为编码器,并引入两个关键模块:全局-局部交互模块(GLIM)和选择性聚合模块(SAM)。GLIM 采用并行结构在多个尺度上融合全局和局部信息,有效捕获细粒度特征。SAM 有选择地将低层特征中的边界细节与高层特征中的语义信息相结合,显著提升了模型准确检测和分割息肉的能力。在五个广泛认可的基准数据集上进行了大量实验,证明了 HiFiSeg 在息肉分割中的有效性。值得注意的是,CVC-ColonDB 和 ETIS 数据集上的 mDice 分别达到0.826和0.822,凸显了 HiFiSeg 在处理该任务特定复杂性方面的卓越性能。

关键词

引用

@article{arxiv.2410.02528,
  title  = {HiFiSeg: High-Frequency Information Enhanced Polyp Segmentation with Global-Local Vision Transformer},
  author = {Jingjing Ren and Xiaoyong Zhang and Lina Zhang},
  journal= {arXiv preprint arXiv:2410.02528},
  year   = {2024}
}