中文

是否存在可提取的知识? 医学精调视觉语言模型的脆弱性证据

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

视觉语言模型 (VLM) 正在通过领域特定微调不断适应,但仍不清楚这是否能提高其推理能力,以超越浅表视觉线索,尤其是在高风险领域如医学中。我们评估了四组配对的开源 VLM (LLaVA 与 LLaVA-Med; Gemma 与 MedGemma),并在四个不断增加难度的医学影像任务上进行测试:脑肿瘤、肺炎、皮肤癌和组织学分类。我们发现随着任务难度的增加,性能趋向接近随机水平,表明临床推理能力有限。医学微调没有提供持续的优势,模型对提示表述高度敏感,细微的更改会导致准确率和拒绝率的大幅波动。为测试封闭形式 VQA 是否抑制了潜在知识,我们引入了一个基于描述的管道,其中模型生成图像描述,该描述被文本-only 模型 (GPT-5.1) 用于诊断。这恢复了有限的额外信号,但仍受任务难度的限制。进一步分析表明,视觉编码器嵌入的失败源于弱视觉表征和下游推理。总体而言,医学 VLM 性能脆弱、提示依赖,且不可靠地通过领域特定微调获得改进。

关键词

引用

@article{arxiv.2604.09841,
  title  = {Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models},
  author = {Oliver McLaughlin and Daniel Shubin and Carsten Eickhoff and Ritambhara Singh and William Rudman and Michal Golovanevsky},
  journal= {arXiv preprint arXiv:2604.09841},
  year   = {2026}
}