中文

通过多尺度信息提取技术增强医学视觉-语言基础模型中的表征

计算机视觉与模式识别 2024-02-27 v2

摘要

医学视觉-语言基础模型的发展因其在各种临床应用中的广阔前景而引起了医学和医疗保健领域的极大关注。虽然先前的研究通常集中于单一学习尺度上的特征学习,但缺乏对整合多尺度信息的研究,这可能阻碍这些特征之间相互增强的潜力。本文旨在通过提出一种有效利用多尺度信息来提升医学基础模型性能的方法来弥合这一差距。所提出的方法同时利用局部、实例、模态和全局层面的特征,促进模型内的全面表征学习。我们在六个涵盖不同临床任务的开源数据集上评估了所提方法的有效性,证明了其提升医学基础模型性能的能力。

关键词

引用

@article{arxiv.2401.01583,
  title  = {Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques},
  author = {Weijian Huang and Cheng Li and Hong-Yu Zhou and Jiarun Liu and Hao Yang and Yong Liang and Guangming Shi and Hairong Zheng and Shanshan Wang},
  journal= {arXiv preprint arXiv:2401.01583},
  year   = {2024}
}