中文

为放射学视觉问答适配轻量级视觉语言模型

计算机视觉与模式识别 2025-06-18 v1 人工智能

摘要

近期视觉语言系统的进展提升了放射学视觉问答(VQA)模型的准确率,但每个模型开发阶段仍面临挑战:受限的专家标注图像阻碍大规模数据获取;放射学图像复杂且细致的模式使建模固有地困难;缺乏评估工作使难以识别模型可能不良条件的案例。在本研究中,我们微调了一个参数量为 3B 的轻量级视觉语言模型,以实现放射学 VQA,展示了在针对 curated 数据进行恰当调优的情况下,小模型可在开放式和封闭式问题上实现稳健的性能。我们提出了从合成问答对生成到针对专门放射学领域数据集(如 ROCO v2.0、MedPix v2.0)进行多阶段微调的高性价比训练流程。我们的结果表明,尽管在规模上远不及 LLaVA-Med 等最先进模型,但该模型在小参数规模和受限训练数据规模下仍实现了有前景的性能。我们引入了一个基于轻量级显著性分析的诊断工具,使领域专家能够通过显著性分析检视 VQA 模型性能,并识别不良条件的失效模式。

关键词

引用

@article{arxiv.2506.14451,
  title  = {Adapting Lightweight Vision Language Models for Radiological Visual Question Answering},
  author = {Aditya Shourya and Michel Dumontier and Chang Sun},
  journal= {arXiv preprint arXiv:2506.14451},
  year   = {2025}
}