用于从文本自动生成图像标注的双模态网络架构
计算机视觉与模式识别
2018-09-09 v1 计算与语言
摘要
医学图像分析从业者已接纳大数据方法,这催生了对大型标注数据集的需求。大数据的来源通常是大型图像集合以及为这些图像记录的临床报告。然而在许多情况下,构建面向疾病分割与检测的算法需要带有图像上感兴趣区域标记、且与所描述异常相匹配的训练数据集。这一标注过程成本高昂且需临床医生参与。本工作中,我们提出两种独立的深度神经网络架构,用于根据给定的文本报告或一组关键词,在图像上自动标记最能代表发现位置的区域(ROI)。一种架构由LSTM和CNN组件构成,并利用图像、匹配文本及这些图像的ROI标记进行端到端训练;输出层估计多边形区域顶点的坐标。第二种架构使用在同一类图像的大型数据集上预训练的网络的网络,以学习感兴趣发现的特征表示。我们表明,对于胸部X射线图像中的多种发现,两种所提架构均能学习估计ROI,并经临床标注验证。采用预训练图像网络的架构具有明显优势:该网络标记的ROI质心与真实ROI质心的平均距离相当于图像宽度的5.1%。
引用
@article{arxiv.1809.01610,
title = {Bimodal network architectures for automatic generation of image annotation from text},
author = {Mehdi Moradi and Ali Madani and Yaniv Gur and Yufan Guo and Tanveer Syeda-Mahmood},
journal= {arXiv preprint arXiv:1809.01610},
year = {2018}
}
备注
Accepted to MICCAI 2018, LNCS 11070