DeepPyram:面向白内障手术视频语义分割的金字塔视图与可变形金字塔感受野方法
计算机视觉与模式识别
2021-09-14 v1 机器学习
摘要
白内障手术中的语义分割具有广泛应用,有助于提升手术效果并降低临床风险。然而,分割不同相关实例时的各种问题使得设计单一网络颇具挑战。本文提出一种称为DeepPyram的语义分割网络,能够在具有不同问题的情况下,优越地分割白内障手术视频中的相关对象。该优越性主要源于三个模块:(i)金字塔视图融合(Pyramid View Fusion),针对输入卷积特征图中每个像素位置提供周围区域的多角度全局视图;(ii)可变形金字塔感受野(Deformable Pyramid Reception),提供可适应感兴趣对象几何变换的宽可变形感受野;(iii)金字塔损失(Pyramid Loss),自适应监督多尺度语义特征图。这些模块能有效提升语义分割性能,尤其在对象存在透明性、可变形性、可缩放性和钝边缘的情况下。所提方法使用四个具有不同上下文特征的白内障手术数据集进行评估,并与十三种最先进(state-of-the-art)分割网络比较。实验结果证实,DeepPyram在不增加可训练参数的情况下优于对比方法。我们全面的消融研究进一步证明了所提模块的有效性。
引用
@article{arxiv.2109.05352,
title = {DeepPyram: Enabling Pyramid View and Deformable Pyramid Reception for Semantic Segmentation in Cataract Surgery Videos},
author = {Negin Ghamsarian and Mario Taschwer and klaus Schoeffmann},
journal= {arXiv preprint arXiv:2109.05352},
year = {2021}
}
备注
12 pages, 10 figures