中文

FluoroSAM:面向灵活 X 射线图像分割的语言可提示基础模型

计算机视觉与模式识别 2025-06-26 v3 人工智能 计算与语言 机器学习

摘要

语言可提示的 X 射线图像分割将为诊断和介入精准医疗中的人机协同工作流带来更大灵活性。此前的工作贡献了能在狭窄范围内解决问题的任务特定模型,但扩展到更广泛的应用则需要额外的数据、标注和训练时间。近年来,语言对齐的基础模型(LFM)——即在大量高度可变的图像和文本数据上训练、因而具备广泛适用性的机器学习模型——已成为自动化图像分析的有前景工具。现有的医学图像分析基础模型聚焦于拥有大规模、丰富标注数据集的场景和模态。然而,X 射线成像模态的特点在于图像外观和应用场景高度可变,从诊断性胸部 X 光片到介入性荧光透视,且数据可用性各不相同。为迈向一个能对任意医学 X 射线图像进行全面且语言对齐分析的 LFM,我们引入了 FluoroSAM,它是 Segment Anything Model 的一种语言可提示变体,从头开始在 300 万张合成 X 射线图像上训练,这些图像涵盖多种人体解剖结构、成像几何和视角,并包含 128 种器官类型和 464 种工具的伪真实掩膜及相关文本描述。得益于在训练过程中创新性地引入了文本嵌入的向量量化(VQ),FluoroSAM 能够根据自然语言提示分割无数解剖结构和工具。我们在真实 X 射线图像上定量展示了 FluoroSAM 的性能,并通过若干应用案例展示了 FluoroSAM 如何在 X 射线图像采集与分析环境中成为丰富人机交互的关键使能器。代码见 https://github.com/arcadelab/fluorosam。

关键词

引用

@article{arxiv.2403.08059,
  title  = {FluoroSAM: A Language-promptable Foundation Model for Flexible X-ray Image Segmentation},
  author = {Benjamin D. Killeen and Liam J. Wang and Blanca Inigo and Han Zhang and Mehran Armand and Russell H. Taylor and Greg Osgood and Mathias Unberath},
  journal= {arXiv preprint arXiv:2403.08059},
  year   = {2025}
}