DeepPyramid:为白内障手术视频语义分割提供金字塔视图与可变形金字塔感受野
计算机视觉与模式识别
2022-07-05 v1
摘要
白内障手术中的语义分割具有广泛应用,有助于提升手术效果并降低临床风险。然而,对这些手术中不同相关结构进行分割时存在的各类问题,使得设计单一网络颇具挑战。本文提出一种称为 DeepPyramid 的语义分割网络,其利用三项创新应对这些挑战:(1)金字塔视图融合模块,在输入卷积特征图中以各像素位置为中心提供周围区域的多角度全局视图;(2)可变形金字塔感受野模块,提供可适应感兴趣对象几何变换的宽可变形感受野;(3)专用的金字塔损失,对多尺度语义特征图进行自适应监督。综合来看,我们表明这些模块能有效提升语义分割性能,尤其在对象的透明性、可变形性、可缩放性与钝边缘情况下。我们证明,我们的方法达到了最先进(SOTA)水平,并以较大优势(与最佳竞争方法相比交并比整体提升 3.66%)超越多种现有方法。
引用
@article{arxiv.2207.01453,
title = {DeepPyramid: Enabling Pyramid View and Deformable Pyramid Reception for Semantic Segmentation in Cataract Surgery Videos},
author = {Negin Ghamsarian and Mario Taschwer and Raphael Sznitman and Klaus Schoeffmann},
journal= {arXiv preprint arXiv:2207.01453},
year = {2022}
}
备注
11 pages, 4 figures, accepted at 25th international conference on Medical Image Computing & Computer Assisted Intervention (MICCAI 2022). arXiv admin note: substantial text overlap with arXiv:2109.05352