中文

通过视觉问答提示医学大视觉语言模型诊断病理

计算机视觉与模式识别 2025-03-18 v3 人工智能 计算与语言 机器学习

摘要

大视觉语言模型(LVLMs)近年来取得了显著成功,并被扩展至医学领域。尽管在医学视觉问答(VQA)任务上表现出令人满意的性能,医学大视觉语言模型(MLVLMs)仍受到幻觉问题的困扰,使其无法诊断复杂病理。此外,由于训练数据不平衡,它们很容易无法学习少数病理。我们为 MLVLMs 提出了两种提示策略,以减少幻觉并提高 VQA 性能。在第一种策略中,我们提供所查询病理的详细解释。在第二种策略中,我们微调一个廉价、弱学习器,使其在特定指标上达到高性能,并将其判断以文本形式提供给 MLVLM。在 MIMIC-CXR-JPG 和 Chexpert 数据集上进行测试,我们的方法显著提高了诊断 F1 分数,最大增幅为 0.27。我们还证明我们的提示策略可以扩展到通用 LVLM 领域。基于 POPE 指标,该方法有效抑制了现有 LVLMs 的假阴性预测,并将召回率提高了约 0.07。

关键词

引用

@article{arxiv.2407.21368,
  title  = {Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering},
  author = {Danfeng Guo and Demetri Terzopoulos},
  journal= {arXiv preprint arXiv:2407.21368},
  year   = {2025}
}

备注

Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:004