中文

用于骨骼 X 射线分析的深度学习表示的自监督视觉-语言对齐

计算机视觉与模式识别 2024-05-16 v1 人工智能 计算与语言

摘要

本文提出利用骨骼 X 射线及其配对的法语报告进行视觉-语言预训练,以解决骨骼放射摄影中感兴趣的下游任务。我们引入了一个实用的处理流水线,用于对法语医疗报告进行匿名化和处理。随后,预训练包括对来自深度模型编码器的视觉和文本嵌入空间进行自监督对齐。生成的图像编码器随后被用于处理各种下游任务,包括骨关节炎的量化、儿科腕部骨龄估计、骨折和异常检测。与需要大量人类专家标注的替代方案相比,我们的方法在下游任务中展现出了具有竞争力的性能。我们的研究是首个整合法语报告以塑造专用于骨骼 X 射线表示的嵌入空间的研究,充分利用了医院中可用的大量配对图像和报告数据。通过在特定语言场景下依赖通用的视觉-语言深度模型,它为将视觉模型部署到更广泛的医疗保健应用中做出了贡献。

关键词

引用

@article{arxiv.2405.08932,
  title  = {Self-supervised vision-langage alignment of deep learning representations for bone X-rays analysis},
  author = {Alexandre Englebert and Anne-Sophie Collin and Olivier Cornu and Christophe De Vleeschouwer},
  journal= {arXiv preprint arXiv:2405.08932},
  year   = {2024}
}