DualPrompt-MedCap:基于双提示增强的医学图像描述生成
计算机视觉与模式识别
2025-04-15 v1
摘要
医学图像描述生成通过视觉语言模型展现出巨大的潜力,用于临床诊断辅助。然而,生成具有上下文相关性且准确识别模态的描述仍具挑战性。我们提出DualPrompt-MedCap,一种 novel 双提示增强框架,通过两个专用组件来增强大规模视觉语言模型(LVLMs):(1) 来自基于医学问答对预训练的半监督分类模型派生的模态感知提示;(2) 利用生物医学语言模型嵌入的问答引导提示。为解决缺乏描述生成ground truth的问题,我们还提出了一个同时考虑空间语义相关性和医学叙事质量的评估框架。实验表明,DualPrompt-MedCap在多个医学数据集上 outperform基线BLIP-3,在模态识别准确率上提升了22%,同时生成更为全面且与问题相吻合的描述。我们的方法能够生成临床上准确的报告,可作为医学专家的先验知识,以及面向下游视觉语言任务的自动标注。
引用
@article{arxiv.2504.09598,
title = {DualPrompt-MedCap: A Dual-Prompt Enhanced Approach for Medical Image Captioning},
author = {Yining Zhao and Ali Braytee and Mukesh Prasad},
journal= {arXiv preprint arXiv:2504.09598},
year = {2025}
}
备注
11 pages, 4 figures, 2 tables