中文

基于生成放射学报告的胸部 X 光视觉问答 grounding

计算机视觉与模式识别 2025-05-23 v1 计算与语言

摘要

我们提出一种新颖的方法,用于胸部 X 光 (CXR) 视觉问答 (VQA),旨在解决单图像图像差异问题。单图像问题聚焦于特定 CXR 内的异常(“图像 X 中看到什么异常?”),而图像差异问题则比较两个不同时间点获取的纵向 CXR(“图像 X 和 Y 有何不同?”)。我们进一步探讨了放射学报告如何提升 VQA 模型性能。虽然先前方法已展示放射学报告在预训练阶段的实用性,但我们延伸该思路,表明报告也可作为额外输入以提高 VQA 模型预测答案的质量。首先,我们提出一种统一方法,能够处理两种类型问题并自回归生成答案。对于单图像问题,模型接收单个 CXR;对于图像差异问题,模型接收来自同一患者、不同时间点的两个 CXR,从而实现检测和描述时间性变化。借鉴“链式思维推理”,我们展示了通过将答案生成器模块与针对相同 CXR 预测的放射学报告进行 grounding, 可提升 CXR VQA 任务的性能。在我们的方案中,VQA 模型分为两个步骤:i) 报告生成 (RG) 和 ii) 答案生成 (AG)。我们的結果表明,将预测的放射学报告作为证据输入给 AG 模型,可提升两种单图像和图像差异问题的性能,在 Medical-Diff-VQA 数据集上实现最先进的成绩。

关键词

引用

@article{arxiv.2505.16624,
  title  = {Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports},
  author = {Francesco Dalla Serra and Patrick Schrempf and Chaoyang Wang and Zaiqiao Meng and Fani Deligianni and Alison Q. O'Neil},
  journal= {arXiv preprint arXiv:2505.16624},
  year   = {2025}
}