中文

基于知识的视觉-语言模型适应策略:为住院医师培训构建乳腺X线筛查独特案例集

计算机视觉与模式识别 2024-05-31 v1

摘要

视觉-语言模型(VLM)在自然图像和文本对上预训练后,由于领域偏移,应用于医学背景时存在显著障碍。然而,将这些VLM适应或微调用于医学用途面临巨大挑战,包括领域不匹配、大规模数据集访问受限以及高度类别不平衡。因此,迫切需要制定有效策略将这些VLM适应到医学领域,因为这种适应在医疗保健应用中极具价值。在本研究中,我们提出一个框架,旨在巧妙地将VLM定制到医学领域,采用选择性采样和难负样本挖掘技术以提升检索任务的性能。我们通过在两个不同的VLM上实施我们的方法验证其有效性:领域内VLM(MedCLIP)和领域外VLM(ALBEF)。我们评估这些模型在原始现成状态以及经过我们提出的训练策略后的性能,使用两个包含乳腺X线图像及其对应报告的大型数据集。我们的评估涵盖零样本、少样本和监督场景。通过我们的方法,我们观察到图像-文本检索任务的Recall@K性能显著提升。

关键词

引用

@article{arxiv.2405.19675,
  title  = {Knowledge-grounded Adaptation Strategy for Vision-language Models: Building Unique Case-set for Screening Mammograms for Residents Training},
  author = {Aisha Urooj Khan and John Garrett and Tyler Bradshaw and Lonie Salkowski and Jiwoong Jason Jeong and Amara Tariq and Imon Banerjee},
  journal= {arXiv preprint arXiv:2405.19675},
  year   = {2024}
}