中文

喉部内镜图像数据集及基于卷积神经网络的语义分割对比研究

计算机视觉与模式识别 2020-09-22 v4 机器学习

摘要

目的:医学图像分析中解剖结构的自动分割是自主诊断以及各种计算机与机器人辅助介入的先决条件。近期基于深度卷积神经网络(CNN)的方法已超越以往的启发式方法。然而,那些方法主要在刚性真实世界环境中评估。在本研究中,现有分割方法被评估用于新的经口内镜探查数据集。方法:SegNet、UNet、ENet 和 ErfNet 四种基于机器学习的方法在包含人类喉部 7 类的新数据集上受监督训练。该数据集包含来自两名患者激光切口期间的 536 张手动分割图像。采用交并比(IoU)评价指标衡量各方法的准确性。使用数据增强与网络集成以提升分割精度。采用随机推理展示各模型的确定性。通过使用患者特定微调研究了患者间迁移。结果:本研究中,UNet 与 ErfNet 的加权平均集成网络最适于喉部软组织分割,平均 IoU 为 84.7%。ENet 效率最高,单张图像平均推理时间为 9.22 ms。研究表明,来自新患者的 10 张额外图像足以进行患者特定微调。结论:基于 CNN 的语义分割方法适用于喉部软组织内镜图像。该分割可用于主动约束或监测形态变化并自主检测病变。通过使用更大数据集或以自监督方式在额外无标签数据上训练模型可取得进一步改进。

关键词

引用

@article{arxiv.1807.06081,
  title  = {A Dataset of Laryngeal Endoscopic Images with Comparative Study on Convolution Neural Network Based Semantic Segmentation},
  author = {Max-Heinrich Laves and Jens Bicker and Lüder A. Kahrs and Tobias Ortmaier},
  journal= {arXiv preprint arXiv:1807.06081},
  year   = {2020}
}

备注

Accepted for publication in International Journal of Computer Assisted Radiology and Surgery