中文

用于临床推理的Chest ImaGenome数据集

计算机视觉与模式识别 2021-08-03 v1 人工智能 计算与语言 机器学习

摘要

尽管近年来从胸部X光(CXR)图像自动检测放射学发现的进展显著,但这些模型可解释性的定量评估因缺乏针对不同发现的局部标注数据集而受阻。除少数针对特定发现(如肺炎与气胸)的专家标注小规模数据集外,迄今大多数CXR深度学习模型均基于从文本报告中提取的全局“弱”标签训练,或通过图像与非结构化文本联合学习策略训练。受计算机视觉界Visual Genome工作的启发,我们构建了首个具有场景图数据结构以描述242,072张图像的Chest ImaGenome数据集。局部标注使用基于规则的联合自然语言处理(NLP)与基于图谱的边界框检测流程自动生成。通过放射科医生构建的CXR本体,每张CXR的标注被连接为以解剖为中心的场景图,可用于图像级推理与多模态融合应用。总体而言,我们提供:i) 29个CXR解剖位置(带边界框坐标的对象)及其属性间的1,256种关系标注组合,按每张图像的场景图结构化;ii) 超过670,000条跨连续检查的解剖位置间局部化比较关系(改善、恶化或无变化);以及iii) 来自500名独特患者的手动标注金标准场景图数据集。

关键词

引用

@article{arxiv.2108.00316,
  title  = {Chest ImaGenome Dataset for Clinical Reasoning},
  author = {Joy T. Wu and Nkechinyere N. Agu and Ismini Lourentzou and Arjun Sharma and Joseph A. Paguio and Jasper S. Yao and Edward C. Dee and William Mitchell and Satyananda Kashyap and Andrea Giovannini and Leo A. Celi and Mehdi Moradi},
  journal= {arXiv preprint arXiv:2108.00316},
  year   = {2021}
}

备注

Dataset available on PhysioNet (https://doi.org/10.13026/wv01-y230)