中文

用显式视觉提示引导医学视觉语言模型:框架设计与提示变体的全面探索

计算机视觉与模式识别 2025-02-13 v2 计算与语言

摘要

虽然主流的视觉语言模型(VLMs)在理解图像级信息方面取得了快速进展,但它们仍然缺乏关注人类指定的特定区域的能力。相反,它们通常依赖大量高质量图像-文本配对数据来学习和生成后验注意力图。为了解决这个关键问题,我们提出利用视觉提示:各种形式的简单视觉标记来引导和增强区域特定注意力的形成。因此,我们引入了MedVP,一个开创性的框架,集成了医学实体提取、视觉提示生成和数据集适应,用于视觉提示引导的微调。我们在多个医学VQA数据集上成功超越了最近最先进的大模型。进行了大量实验和人工评估,以分析不同视觉提示形式的影响以及它们如何促进性能提升。结果证明了我们方法的有效性和临床意义。

关键词

引用

@article{arxiv.2501.02385,
  title  = {Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations},
  author = {Kangyu Zhu and Ziyuan Qin and Huahui Yi and Zekun Jiang and Qicheng Lao and Shaoting Zhang and Kang Li},
  journal= {arXiv preprint arXiv:2501.02385},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Main Conference