中文

面向医学影像分析的大型视觉语言模型:一项实证研究

计算机视觉与模式识别 2024-02-23 v1 人工智能

摘要

近年来,大型语言模型(LLMs)在自然语言处理领域备受瞩目。此外,将 LLMs 与视觉能力相结合,使用户能够探索多模态数据中的涌现能力。视觉语言模型(VLMs),如 LLaVA、Flamingo 或 CLIP,已在各种视觉 - 语言任务中展现出令人印象深刻的性能。因此,大型模型在生物医学影像领域具有巨大的潜在应用价值。然而,目前尚缺乏相关工作来展示大型模型在疾病诊断方面的能力。在本工作中,我们研究了 VLMs 在医学影像分析任务中的零样本和少样本鲁棒性。我们的综合实验证明了 VLMs 在分析脑部 MRI、血细胞显微图像和胸部 X 射线等生物医学图像方面的有效性。

关键词

引用

@article{arxiv.2402.14162,
  title  = {On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study},
  author = {Minh-Hao Van and Prateek Verma and Xintao Wu},
  journal= {arXiv preprint arXiv:2402.14162},
  year   = {2024}
}