中文

像放射科医生一样阅读:用于 3D 医学影像解读的高效视觉-语言模型

图像与视频处理 2024-12-19 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

最近的医学视觉-语言模型(VLM)在 2D 医学图像解读中显示出潜力。然而,由于计算复杂性和数据稀缺,将其扩展到 3D 医学影像一直具有挑战性。尽管最近出现了一些专门用于 3D 医学影像的 VLM,但它们都局限于将 3D 医学影像的体积表示学习为一组子体积特征。这种过程引入了沿 z 轴的过度相关表示,忽略了切片特定的临床细节,特别是对于相邻切片冗余度低的 3D 医学影像。为了解决这一局限性,我们引入了 MS-VLM,它模仿放射科医生在 3D 医学影像解读中的工作流程。具体来说,放射科医生通过依次检查单个切片并综合跨切片和跨视图的信息来分析 3D 医学影像。同样,MS-VLM 利用自监督的 2D Transformer 编码器,从一系列切片特定特征中学习捕获切片间依赖关系的体积表示。不受子体积分块限制,MS-VLM 能够从任意切片长度的 3D 医学影像以及从不同平面和相位获取的多幅图像中获得有用的体积表示。我们在公开的胸部 CT 数据集 CT-RATE 和内部直肠 MRI 数据集上评估了 MS-VLM。在两种场景下,MS-VLM 在放射学报告生成方面均超越了现有方法,生成了更连贯且临床相关的报告。这些发现凸显了 MS-VLM 在推进 3D 医学影像解读和提高医学 VLM 鲁棒性方面的潜力。

关键词

引用

@article{arxiv.2412.13558,
  title  = {Read Like a Radiologist: Efficient Vision-Language Model for 3D Medical Imaging Interpretation},
  author = {Changsun Lee and Sangjoon Park and Cheong-Il Shin and Woo Hee Choi and Hyun Jeong Park and Jeong Eun Lee and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2412.13558},
  year   = {2024}
}