中文

基于神经网络与语音辅助的内镜超声图像标注及分类

计算机视觉与模式识别 2022-02-01 v1 机器学习

摘要

超声成像是一种在诊断和治疗过程中实时可视化患者解剖结构的常用技术。其高度依赖操作者且可重复性低,使得超声成像与解读具有挑战性并存在陡峭的学习曲线。使用深度学习的自动图像分类有潜力通过辅助新手进行超声训练,以及帮助经验更丰富的医师对复杂病变患者进行超声图像解读,来克服其中部分挑战。然而,深度学习方法的运用需要大量数据以提供准确结果。标注大型超声数据集是一项艰巨任务,因为标签是在事后分配给二维图像的,缺乏体内可用的三维空间上下文,或是在操作过程中通过帧间视觉追踪结构所能推断的上下文。在本工作中,我们提出一种多模态卷积神经网络(CNN)架构,该架构根据临床医师在操作过程中提供的原始语音评论对内镜超声(EUS)图像进行标注。我们使用一个由两支组成的CNN,一支处理语音数据,另一支处理图像数据,二者联合以从解剖标志的口语名称预测图像标签。该网络使用专家操作者的录音语音评论进行训练。我们的结果显示,在一个含5种不同标签的数据集上,图像级预测准确率达76%。我们得出结论:加入语音解说可提升超声图像分类性能,并消除深度学习应用所需的大型EUS数据集人工标注的负担。

关键词

引用

@article{arxiv.2110.06367,
  title  = {Voice-assisted Image Labelling for Endoscopic Ultrasound Classification using Neural Networks},
  author = {Ester Bonmati and Yipeng Hu and Alexander Grimwood and Gavin J. Johnson and George Goodchild and Margaret G. Keane and Kurinchi Gurusamy and Brian Davidson and Matthew J. Clarkson and Stephen P. Pereira and Dean C. Barratt},
  journal= {arXiv preprint arXiv:2110.06367},
  year   = {2022}
}

备注

Submitted to IEEE TMI