中文

面向纵向胸部 X 光片差异视觉问答的视觉-语言模型预训练

计算机视觉与模式识别 2024-12-16 v3 计算与语言

摘要

差异视觉问答(diff-VQA)是一项具有挑战性的任务,要求基于一对图像之间的差异回答复杂问题。该任务在阅读胸部 X 光图像中尤为重要,因为放射科医生在临床实践中经常比较同一患者在不同时间拍摄的多张图像,以追踪疾病进展及其严重程度的变化。然而,以往的工作侧重于为 diff-VQA 任务设计特定的网络架构,错失了利用预训练视觉-语言模型(VLM)来提升模型性能的机会。在此,我们引入了一种名为 PLURAL 的新型 VLM,该模型在自然图像和纵向胸部 X 光数据上进行了预训练,用于 diff-VQA 任务。该模型采用分步方法开发,首先在自然图像和文本上进行预训练,随后使用纵向胸部 X 光数据进行训练。纵向数据由成对的 X 光图像、问答集以及描述肺部异常和疾病随时间变化的放射科医生报告组成。我们的实验结果表明,PLURAL 模型不仅在纵向 X 光片的 diff-VQA 任务上,而且在单张 X 光图像的常规 VQA 任务上,均优于最先进的方法。通过大量实验,我们证明了所提出的 VLM 架构和预训练方法在提升模型性能方面的有效性。

关键词

引用

@article{arxiv.2402.08966,
  title  = {Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays},
  author = {Yeongjae Cho and Taehee Kim and Heejun Shin and Sungzoon Cho and Dongmyung Shin},
  journal= {arXiv preprint arXiv:2402.08966},
  year   = {2024}
}