中文

面向多模态大语言模型的高质量显微镜推理数据集 MicroVQA++

计算机视觉与模式识别 2025-11-17 v1

摘要

多模态大语言模型正在广泛应用于生物医学成像,但因缺乏大规模高质量训练数据,显微镜科学推理仍受限。我们引入MicroVQA++,一个三阶段构建的大规模高质量显微镜VQA语料库,源自BIOMEDICA档案。第一阶段从专家验证的图表-标题对中引导监督信号。第二阶段应用HiCQA-Graph—a一种融合了基于NLI的文本蕴涵、CLIP-based视觉语言对齐及智能体信号的异构图,识别并过滤不一致样本。第三阶段使用多模态大语言模型(MLLM)代理生成多选题,随后进行人工筛选。最终数据集包含大规模训练集和人工核查的测试集,其Bloom's水平难样本分布超越MicroVQA基准。我们的工作提供:(i)质量可控的数据集,将专家文献与图谱式过滤和人工精炼相结合;(ii)HiCQA-Graph,首个联合建模(图像、标题、QA)的图结构,用于跨模态一致性过滤;(iii)严谨的数据构建使4B规模的MLLM达到竞争性显微镜推理性能(如GPT-5),并在开源MLLM中实现最新性能。代码与数据集将在审稿结束后发布。

关键词

引用

@article{arxiv.2511.11407,
  title  = {MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimodal Large Language Model},
  author = {Manyu Li and Ruian He and Chenxi Ma and Weimin Tan and Bo Yan},
  journal= {arXiv preprint arXiv:2511.11407},
  year   = {2025}
}

备注

11 pages, 4 figures