中文

PET/CT 中的视觉-语言建模用于阳性发现的视觉定位

计算机视觉与模式识别 2025-02-04 v1 计算与语言

摘要

视觉-语言模型可以通过视觉定位将对象的文本描述与其在图像中的特定位置联系起来。这在增强放射学报告方面具有潜在应用。然而,这些模型需要大量带标注的图像-文本数据集,而 PET/CT 缺乏此类数据集。我们开发了一条自动化流程,用于生成将 PET/CT 报告描述与其图像位置联系起来的弱标签,并用其训练了一个 3D 视觉-语言视觉定位模型。我们的流程通过识别 SUVmax 和轴向切片编号的提及来发现 PET/CT 报告中的阳性发现。我们从 25,578 例 PET/CT 检查中提取了 11,356 个句子-标签对。利用这些数据,我们训练了 ConTEXTual Net 3D,该模型通过令牌级交叉注意力将大型语言模型的文本嵌入与 3D nnU-Net 集成。该模型的性能与 LLMSeg、ConTEXTual Net 的 2.5D 版本以及两位核医学医师进行了比较。弱标签流程在 98% 的病例(246/251)中准确识别了病灶位置,其中 7.5% 需要边界调整。ConTEXTual Net 3D 的 F1 分数达到 0.80,优于 LLMSeg(F1=0.22)和 2.5D 模型(F1=0.53),但低于两位医师(F1=0.94 和 0.91)。该模型在 FDG(F1=0.78)和 DCFPyL(F1=0.75)检查上取得了更好的性能,而在 DOTATE(F1=0.58)和 Fluciclovine(F1=0.66)上性能下降。该模型在不同病灶大小上表现一致,但在低摄取病灶上准确性降低。我们新颖的弱标签流程准确地生成了 PET/CT 图像-文本对的标注数据集,促进了 3D 视觉定位模型的发展。ConTEXTual Net 3D 显著优于其他模型,但未达到核医学医师的性能。我们的研究表明,可能需要更大的数据集来缩小这一性能差距。

关键词

引用

@article{arxiv.2502.00528,
  title  = {Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings},
  author = {Zachary Huemann and Samuel Church and Joshua D. Warner and Daniel Tran and Xin Tie and Alan B McMillan and Junjie Hu and Steve Y. Cho and Meghan Lubner and Tyler J. Bradshaw},
  journal= {arXiv preprint arXiv:2502.00528},
  year   = {2025}
}