搭建语义鸿沟:通过 LLM 增强的问题集提升医学 VQA 的一致性
计算机视觉与模式识别
2025-04-17 v1 机器学习
摘要
医学视觉问答(MVQA)系统能够根据自然语言查询解读医学图像。然而,问题表述中的语言多样性常常会削弱这些系统的一致性。为此,我们提出了基于大语言模型(LLM)生成语义等价问题的 Semantically Equivalent Question Augmentation(SEQA)框架,具体而言,该方法在保持语义含义的前提下,丰富语言多样性。我们进一步引入了评估指标——带语义等价输入且答案正确的总体一致性率(TAR-SC),用于评估模型对语义等价语言变体生成一致且正确响应的能力。此外,我们还提出了另外三个多样性指标:每个图像的平均 QA 项目数(ANQI)、每个图像相同答案问题数平均值(ANQA)以及每个图像相同语义开放式问题数平均值(ANQS)。借助 SEQA 框架,我们对 SLAKE、VQA-RAD 和 PathVQA 等公开 MVQA 数据集进行了增强。结果显示,三大数据集均通过纳入更多语义等价问题实现了显著提升:ANQI 平均提升 86.1,ANQA 平均提升 85.1,ANQS 平均提升 46。随后,我们在增强后的数据集上,以零样本和微调两种设置评估了三类 MVQA 模型(M2I2、MUMC 和 BiomedGPT)。实验结果表明,微调后模型在 MVQA 数据集上的平均准确率提升 19.35%,而我们提出的 TAR-SC 指标平均提升 11.61%,显示出在模型一致性方面实现了显著增强。
引用
@article{arxiv.2504.11777,
title = {Bridging the Semantic Gaps: Improving Medical VQA Consistency with LLM-Augmented Question Sets},
author = {Yongpei Ma and Pengyu Wang and Adam Dunn and Usman Naseem and Jinman Kim},
journal= {arXiv preprint arXiv:2504.11777},
year = {2025}
}
备注
The first two listed authors contributed equally to this work