MicroWorld:利用多模态属性图增强多模态大语言模型以弥合微观领域鸿沟
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
多模态大语言模型(MLLMs)展现出科学推理的巨大潜力,但其在显微镜学等专业领域的表现仍因缺乏领域特定训练数据以及将细粒度专家知识编码到模型参数中的困难而受限。为了弥合这一鸿沟,我们引入 MicroWorld,这是一个从大规模科学图像-文本语料库构建多模态属性图(MAPG)并利用其在推理时增强 MLLM 推理而无需任何领域特定微调的框架。MicroWorld 通过 scispaCy 或基于 LLM 的三元组挖掘提取生物医学实体与关系,使用 Qwen3-VL-Embedding 在共享嵌入空间中对齐图像与实体,并组装了一个包含约 111K 个节点和 346K 条类型化边、跨越八种关系类别的知识图谱。在推理时,图增强检索管道将查询实体匹配到 MAPG 并将结构化知识上下文注入 MLLM 提示中。在 MicroVQA 基准上,MicroWorld 将 Qwen3-VL-8B-Instruct 的推理性能提升了 37.5%,以 13.0% 的优势超越 GPT-5,达到了新的 SOTA。此外,它在 MicroBench 基准上也取得了 6.0% 的性能提升。大量实验证明了 MicroWorld 引入的增强泛化能力。定性案例研究进一步揭示了结构化知识改善推理的机制以及指向未来有前景方向的失败模式。代码和数据可在 https://github.com/ieellee/MicroWorld 获取。
引用
@article{arxiv.2605.10120,
title = {MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph},
author = {Manyu Li and Ruian He and Chenxi Ma and Weimin Tan and Bo Yan},
journal= {arXiv preprint arXiv:2605.10120},
year = {2026}
}
备注
29 pages, 14 figures