中文

R-LLaVA:通过视觉感兴趣区域改善医学视觉问答理解

计算机视觉与模式识别 2025-03-11 v5 人工智能

摘要

人工智能在医学视觉问答(Med-VQA)领域取得了显著进展,然而现有研究通常从整体上解读图像,忽略了可能包含关键信息的视觉感兴趣区域,这些区域可能与医生先验知识相契合,并可通过极少的标注(如边界框)加以引入。为弥补这一不足,本文提出了 R-LLaVA,旨在通过 CLIP 将简单的医学标注作为先验知识直接整合到图像空间中,从而增强生物医学 VQA 理解。在训练期间,这些标注的视觉感兴趣区域被输入到 LLaVA 模型中,旨在丰富模型对生物医学查询的理解。在四个标准 Med-VQA 数据集上的实验评估表明,R-LLaVA 优于现有的最先进(SoTA)方法。此外,为验证模型的视觉理解能力,引入了一个新颖的多项选择医学视觉理解数据集,证实了关注视觉感兴趣区域对推进生物医学 VQA 理解的积极影响。

关键词

引用

@article{arxiv.2410.20327,
  title  = {R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest},
  author = {Xupeng Chen and Zhixin Lai and Kangrui Ruan and Shichu Chen and Jiaxiang Liu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2410.20327},
  year   = {2025}
}