中文

使用大型语言模型进行医学多模态检索增强生成用于医学视觉问答

计算与语言 2025-10-17 v1 人工智能 计算机视觉与模式识别

摘要

医学视觉问答(MedVQA)通过自然语言查询医学图像,支持临床决策和患者护理。2025年MEDIQA-WV共享任务聚焦伤口护理视觉问答,要求系统从图像和患者查询中生成自由文本响应及结构化伤口属性。我们提出的MasonNLP系统采用通用领域指令调优大型语言模型,构建检索增强生成(RAG)框架,整合来自领域内数据的文本与视觉示例。该方法以临床相关范例为依据,提升了推理能力、模式遵循性和响应质量,综合dBLEU、ROUGE、BERTScore及LLM评估指标。我们的最佳系统在19支队伍、51个提交中排名第3,平均得分达41.37%,表明轻量化RAG搭配通用大模型——即通过简单索引和融合添加少量相关范例,无需额外训练或复杂重排序——为多模态临床NLP任务提供了简单且有效的基线。

关键词

引用

@article{arxiv.2510.13856,
  title  = {Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA},
  author = {A H M Rezaul Karim and Ozlem Uzuner},
  journal= {arXiv preprint arXiv:2510.13856},
  year   = {2025}
}