中文

基于大规模肺炎与气胸研究的使用弱监督单阶段视觉与语言疾病检测

计算机视觉与模式识别 2020-08-03 v1 机器学习 图像与视频处理

摘要

尽管拥有大型数据集,由于缺少精细标注,在医学图像中检测临床相关目标仍具挑战。为应对标注问题,我们利用场景级标签与一种融合自然语言信息的检测架构。我们在公开可用的 MIMIC-CXR 数据集上提出一组具有挑战性的放射科医生配对的边界框与自然语言标注,尤其聚焦于肺炎与气胸。除数据集外,我们提出一种联合视觉语言弱监督 transformer 层选择单阶段双头检测架构 (LITERATI),并与类激活映射 (CAM)、梯度 CAM 及在 NIH ChestXray-14 与 MIMIC-CXR 数据集上的相关实现进行强基线对比。借鉴视觉语言架构的进展,LITERATI 方法展示了联合图像与指称表达(用自然语言在图像中定位的目标)输入的检测,并以纯弱监督方式扩展。该架构改进解决了三个障碍——以弱监督方式实现有监督视觉语言检测方法、融入临床指称表达自然语言信息、以及生成具映射概率的高保真检测。尽管如此,放射科医生标注所具有的挑战性临床性质,包括细微指称、多实例说明及相对冗长的底层医学报告,确保了大规模视觉语言检测任务对未来的研究仍具启发性。

关键词

引用

@article{arxiv.2007.15778,
  title  = {Weakly supervised one-stage vision and language disease detection using large scale pneumonia and pneumothorax studies},
  author = {Leo K. Tam and Xiaosong Wang and Evrim Turkbey and Kevin Lu and Yuhong Wen and Daguang Xu},
  journal= {arXiv preprint arXiv:2007.15778},
  year   = {2020}
}

备注

Accepted at Medical Image Computing and Computer-Assisted Intervention -- MICCAI 2020