中文

利用生成器-验证器大语言模型从医学文档合成高质量视觉问答

机器学习 2026-02-19 v2

摘要

大型多模态模型(LMM)越来越能够回答需要对图像和文本进行联合推理的医学问题,然而训练通用的医学VQA系统受到缺乏大型、可公开使用、高质量语料库的阻碍。我们提出了MedVLSynther,一个基于评分标准的生成器-验证器框架,它通过以图表、标题和文中参考文献为条件,直接从开放生物医学文献中合成高质量的多选题VQA项目。生成器在机器可检查的JSON模式下生成自包含的题干和平行的、互斥的选项;一个多阶段验证器在接收前强制执行基本门控(自包含性、单一正确答案、临床有效性、图像-文本一致性),授予细粒度正分,并惩罚常见失败模式。将此流程应用于PubMed Central产生了MedSynVQA:涵盖13种成像模态和28个解剖区域的14,803张图像上的13,087个经过审核的问题。使用可验证奖励对开放权重LMM进行强化学习训练,提高了六个医学VQA基准的准确率,在3B和7B模型上分别达到55.85和58.15的平均分,在VQA-RAD上高达77.57,在PathVQA上高达67.76,优于强大的医学LMM。消融实验验证了生成和验证都是必要的,并且更多经过验证的数据持续有益,而针对性的污染分析未检测到来自评估套件的泄漏。通过完全基于开放文献和开放权重模型运行,MedVLSynther为可扩展的医学VQA训练数据提供了一条可审计、可复现且保护隐私的路径。

关键词

引用

@article{arxiv.2510.25867,
  title  = {Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs},
  author = {Xiaoke Huang and Ningsen Wang and Hui Liu and Xianfeng Tang and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2510.25867},
  year   = {2026}
}

备注

Project page, code, data, and models: https://ucsc-vlaa.github.io/MedVLSynther/ ; Accepted by ICLR'26