中文

多图像医学推理

计算机视觉与模式识别 2026-05-05 v2 计算与语言

摘要

大型语言模型在许多医学 QA 基准测试中表现良好,但真实临床推理往往需要整合多个视角证据,而非仅解释单一视图。我们引入 MedThinkVQA,这是一个经专家标注的多图像思考基准,要求模型解释每张图像、整合跨视图证据并在有中间监督与分级评估的情况下回答诊断性问题。该数据集包含 8067 例案例,其中 720 例为测试集,平均每例包含 6.62 张图像,远高于先前工作(其专家级基准每例至多仅 1.43 张图像)。在测试集上,最佳闭源模型——Claude-4.6-Opus、Gemini-3-Pro 与 GPT-5.2-xhigh——分别仅达到 57.2%、55.3% 与 54.9% 的准确率;而 GPT-5-mini 与 GPT-5-nano 分别为 39.7% 与 30.8%。强大的开源模型紧随其后,以 Qwen3.5-397B-A17B 实现 52.2%,Qwen3.5-27B 实现 50.6%。进一步分析识别出基于多图像的推理是主要瓶颈:模型常常未能在进行高层推理前提取、对齐并组合跨视图证据。提供专家单视图线索和跨视图摘要可提升性能,而替换为自生成的中间结果则会降低准确率。分级分析表明,超过 70% 的错误源自图像阅读与跨视图整合。扩展实验进一步表明,仅当视觉对齐已相对可靠时,额外的推理时间计算才有助于提升性能;当早期证据提取较弱时,更长的推理路径仅带来有限甚至不稳定的收益,甚至可能放大误读的线索。这些结果表明,关键挑战并非推理深度本身,而是可靠地对跨真实世界多模态临床输入进行证据提取、对齐与组合的机制。

关键词

引用

@article{arxiv.2604.16506,
  title  = {Medical thinking with multiple images},
  author = {Zonghai Yao and Benlu Wang and Yifan Zhang and Junda Wang and Iris Xia and Zhipeng Tang and Shuo Han and Feiyun Ouyang and Zhichao Yang and Arman Cohan and Hong Yu},
  journal= {arXiv preprint arXiv:2604.16506},
  year   = {2026}
}

备注

Equal contribution for the first two authors. To appear in the proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026). Code is in https://github.com/benluwang/MedThinkVQA. Dataset is in https://huggingface.co/datasets/bio-nlp-umass/MedThinkVQA