中文

MOTOR:基于 grounding 检索的医学视觉问答中的多模态最优传输

计算机视觉与模式识别 2025-11-10 v1 计算与语言

摘要

医学视觉问答(MedVQA)在通过提供基于图像查询的上下文丰富答案方面发挥着临床决策的重要作用。尽管视觉语言模型(VLMs)被广泛用于此任务,但它们常常会生成事实错误的答案。检索增强生成通过提供外部来源的信息来解决此挑战,但风险在于检索到不相关的上下文,这可能会损害VLMS的推理能力。现有方法引入的重新排序检索通过聚焦查询-文本对齐来增强检索相关性,但这些方法忽略了视觉或多模态上下文,这在医学诊断中尤为重要。我们提出了MOTOR,一种新的多模态检索和重新排序方法,利用grounding 标题和最优传输。它基于文本和视觉信息捕捉查询与检索上下文之间的底层关系。因此,我们的方法识别更多与临床相关的上下文来增强VLM输入。经验分析和人类专家评估表明,MOTOR在MedVQA数据集上实现了更高的准确率,相较于最先进的方法平均提升了6.45%。代码已公开于https://github.com/BioMedIA-MBZUAI/MOTOR。

关键词

引用

@article{arxiv.2506.22900,
  title  = {MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering},
  author = {Mai A. Shaaban and Tausifa Jan Saleem and Vijay Ram Papineni and Mohammad Yaqub},
  journal= {arXiv preprint arXiv:2506.22900},
  year   = {2025}
}