中文

用于胸部 X 射线的基于定位的知识增强医学视觉-语言预训练

计算机视觉与模式识别 2025-02-18 v2 人工智能

摘要

医学基础模型有望通过提供稳健且泛化的医学数据表示来彻底改变医疗保健。医学视觉-语言预训练已成为学习医学图像与文本领域通用表示的一种有前景的方法。然而,利用医学图像与文本之间全局和局部对齐的现有算法可能会受到医学数据中冗余信息的影响。为了解决这一问题,我们提出了一种用于胸部 X 射线的基于定位的知识增强医学视觉-语言预训练(GK-MVLP)框架。在该框架中,通过使用基于 Transformer 的定位知识增强模块,将医学知识定位到相应的解剖区域,以实现医学知识的纹理特征与对应解剖区域级视觉特征之间的细粒度对齐。GK-MVLP 在下游图像理解任务(胸部 X 射线疾病分类、疾病定位)、生成任务(报告生成)以及视觉-语言理解任务(医学视觉问答)上的表现具有竞争力或超越了现有最高水平。我们的结果证明了引入定位机制以消除偏差并改善胸部 X 射线图像与放射学报告之间对齐的优势。

关键词

引用

@article{arxiv.2404.14750,
  title  = {Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray},
  author = {Qiao Deng and Zhongzhen Huang and Yunqi Wang and Zhichuan Wang and Zhao Wang and Xiaofan Zhang and Qi Dou and Yeung Yu Hui and Edward S. Hui},
  journal= {arXiv preprint arXiv:2404.14750},
  year   = {2025}
}