中文

ConTEXTual Net:用于气胸分割的多模态视觉-语言模型

计算机视觉与模式识别 2023-09-19 v2

摘要

放射学叙述报告常描述患者疾病的特征,包括其位置、大小和形状。受多模态学习近期成功的启发,我们假设此类描述性文本可指导医学图像分析算法。我们提出了一种新颖的视觉-语言模型ConTEXTual Net,用于胸部X光片上气胸分割任务。ConTEXTual Net利用通过预训练语言模型从相应自由文本放射学报告中提取的语言特征。交叉注意力模块被设计用于结合每个视觉编码器层的中间输出与语言模型生成的文本嵌入。ConTEXTual Net在CANDID-PTX数据集上训练,该数据集包含3,196例气胸阳性病例,具有来自6位不同医师的分割标注以及临床放射学报告。通过交叉验证,ConTEXTual Net取得了0.716±\pm0.016的Dice分数,与在数据子集上计算出的读者间变异度(0.712±\pm0.044)相近。它优于纯视觉模型(ResNet50 U-Net: 0.677±\pm0.015和GLoRIA: 0.686±\pm0.014)及一个竞争视觉-语言模型(LAVT: 0.706±\pm0.009)。消融实验证实性能提升源于文本信息。此外,我们展示某些增强方法因破坏图像-文本一致性而降低了ConTEXTual Net的分割性能。我们还评估了在交叉注意力模块中使用不同语言模型和激活函数的影响,凸显了我们所选架构设计的有效性。

关键词

引用

@article{arxiv.2303.01615,
  title  = {ConTEXTual Net: A Multimodal Vision-Language Model for Segmentation of Pneumothorax},
  author = {Zachary Huemann and Xin Tie and Junjie Hu and Tyler J. Bradshaw},
  journal= {arXiv preprint arXiv:2303.01615},
  year   = {2023}
}