中文

MMXU:用于疾病进程的多模态和多 X 射线理解数据集

数值分析 2025-02-18 v1 数值分析

摘要

大型视觉语言模型 (LVLMs) 在医学应用中展现出巨大潜力,尤其在视觉问答 (MedVQA) 和从医学图像诊断方面取得显著成果。然而,现有数据集和模型往往未能考虑医学诊断中的关键因素,如历史记录的整合以及对疾病进程的分析。本文引入 MMXU (Multimodal and MultiX-ray Understanding),是一个专注于识别两次患者就诊之间特定区域变化的 MedVQA 数据集。不同于以单图像问题为主的数据集,MMXU 支持多图像问题,融合当前和历史患者数据。我们展示了当前 LVLMs 在 MMXU-test 上的识别疾病进程能力的局限性,即使是在传统基准测试上表现良好的模型也难以胜任。为此,我们提出了 MedRecord-Augmented Generation (MAG) 方法,融合全局和区域历史记录。我们的实验表明,整合历史记录可将诊断准确率提高至少20%,弥合了当前 LVLMs 与人类专家性能之间的差距。此外,我们在 MMXU-dev 上对模型采用 MAG 进行微调,显示出显著的改进。我们希望本工作能够阐明 LVLMs 在医学诊断中的应用路径,强调历史背景在解释医学图像中的重要性。本数据集已发布于 github: https://github.com/linjiemu/MMXU。

关键词

引用

@article{arxiv.2502.11652,
  title  = {A new banded Petrov--Galerkin spectral method},
  author = {Ouyuan Qin and Lu Cheng and Kuan Xu},
  journal= {arXiv preprint arXiv:2502.11652},
  year   = {2025}
}