中文

医学可解释视觉问答的多组件框架 MedXplain-VQA

计算机视觉与模式识别 2025-10-28 v1

摘要

可解释性是医学视觉问答(VQA)系统在临床应用中不可或缺的因素,因为医生需要透明的推理才能信任AI生成的诊断结果。我们提出了MedXplain-VQA,一个综合性框架集成五个可解释人工智能组件,以提供可解释的医学图像分析。该框架利用微调的BLIP-2 backbone,结合医学查询改写、增强的Grad-CAM注意力、精确的区域提取以及通过多模态语言模型实现的结构化链式推理。为评估该系统,我们引入了一个针对医学领域的特定框架,取代传统NLP指标,以临床相关评估取代,包括术语覆盖率、临床结构质量和注意力区域相关性。在500个PathVQA组织病理样本上的实验显示,增强系统的综合得分提升至0.683,而基线方法为0.378,同时保持高推理置信度(0.890)。我们的系统在每个样本上识别3-5个诊断相关区域,并生成平均57词的结构化解释,包含适当的临床术语。消融研究表明,查询改写提供了最显著的初始改进,而链式推理则实现了系统的诊断过程。这些发现凸显了MedXplain-VQA作为一个稳健、可解释医学VQA系统的潜力。未来工作将重点关注与医学专家和大规模临床数据集的验证,以确保临床准备就绪。

关键词

引用

@article{arxiv.2510.22803,
  title  = {MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering},
  author = {Hai-Dang Nguyen and Minh-Anh Dang and Minh-Tan Le and Minh-Tuan Le},
  journal= {arXiv preprint arXiv:2510.22803},
  year   = {2025}
}

备注

10 pages, 4 figures, IEEE conference format