中文

利用视觉-语言基础模型揭示医学影像中隐藏的图像-属性关系

计算机视觉与模式识别 2025-04-01 v1

摘要

视觉-语言基础模型(VLM)在通过文本引导图像生成方面展现出卓越性能,其在医学影像领域的应用也日益增多。在本工作中,我们首次探讨了这样一个问题:“微调后的基础模型能否帮助识别关键的、甚至未知的数据属性?”通过在胸部X射线数据集上评估我们提出的方法,我们证明,与依赖结构因果模型(SCM)的方法相比,这些模型能够根据众多指标生成高分辨率、精确编辑的图像。我们首次证明,微调后的VLM能够揭示先前因可用元数据粒度和模型容量限制而被掩盖的隐藏数据关系。我们的实验既展示了这些模型在揭示底层数据集属性方面的潜力,也暴露了微调VLM在精确图像编辑方面的局限性及其对偏差和虚假相关性的敏感性。

关键词

引用

@article{arxiv.2503.23618,
  title  = {Leveraging Vision-Language Foundation Models to Reveal Hidden Image-Attribute Relationships in Medical Imaging},
  author = {Amar Kumar and Anita Kriz and Barak Pertzov and Tal Arbel},
  journal= {arXiv preprint arXiv:2503.23618},
  year   = {2025}
}