中文

基于 SAM 引导的混合语义学习增强细粒度编码用于医学图像描述

计算机视觉与模式识别 2024-01-02 v2 人工智能

摘要

随着多模态与大语言模型的发展,基于深度学习的医学图像描述技术有潜力提供有价值的诊断建议。然而,当前的通用文本与图像预训练模型在描述医学图像中复杂细节时效果不尽如人意。本文中,我们提出一种由 segment anything model(SAM)引导的新型医学图像描述方法,以通过通用与细节特征提取实现增强编码。此外,我们的方法采用一种独特的混合语义学习预训练策略,同时捕捉医学图像中的整体信息与更精细细节。我们证明了该方法的有效性,因其在生成医学图像描述的各项评估指标上优于预训练的 BLIP2 模型。

关键词

引用

@article{arxiv.2311.01004,
  title  = {Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning},
  author = {Zhenyu Zhang and Benlu Wang and Weijie Liang and Yizhi Li and Xuechen Guo and Guanhong Wang and Shiyan Li and Gaoang Wang},
  journal= {arXiv preprint arXiv:2311.01004},
  year   = {2024}
}