面向3D CT图像的完整放射学报告视觉定位
计算机视觉与模式识别
2023-12-11 v1
摘要
构建大规模训练数据集是医学图像识别系统发展中的关键问题。视觉定位技术能够自动将图像中的对象与对应描述相关联,可促进大量图像的标注。然而,CT图像放射学报告的视觉定位仍具挑战性,因为CT成像可检测出多种异常,且生成的报告描述冗长且复杂。本文提出了首个针对CT图像与报告对设计的视觉定位框架,涵盖各种身体部位和多种异常类型。我们的框架结合了两个组件:1)图像的解剖分割,以及2)报告结构化。解剖分割为给定CT图像提供多个器官掩码,并帮助定位模型识别详细的解剖结构。报告结构化有助于从对应报告中准确提取每种异常的存在、位置和类型信息。鉴于这两项额外的图像/报告特征,定位模型能够实现更好的定位效果。在验证过程中,我们构建了一个包含区域-描述对应标注的大规模数据集,涵盖7,321名独立患者的10,410项检查。我们使用定位准确率(即正确局部化异常的百分比)作为指标评估了我们的框架,并证明了解剖分割与报告结构化的结合相较于基线模型大幅提升了性能(66.0% vs 77.8%)。与现有技术的比较也表明我们的方法具有更高的性能。
引用
@article{arxiv.2312.04794,
title = {Visual Grounding of Whole Radiology Reports for 3D CT Images},
author = {Akimichi Ichinose and Taro Hatsutani and Keigo Nakamura and Yoshiro Kitamura and Satoshi Iizuka and Edgar Simo-Serra and Shoji Kido and Noriyuki Tomiyama},
journal= {arXiv preprint arXiv:2312.04794},
year = {2023}
}
备注
14 pages, 7 figures. Accepted at MICCAI 2023