中文

面向差异感知医学视觉问答的专家知识感知图像差异图表示学习

计算机视觉与模式识别 2024-08-29 v2 机器学习

摘要

为推动医学视觉-语言模型的自动化,我们提出了一种新颖的胸片差异视觉问答(VQA)任务。给定一对主图像与参考图像,该任务试图回答关于疾病以及更重要的是二者之间差异的若干问题。这与放射科医生的诊断实践一致,即在得出报告前将当前图像与参考图像进行比较。我们收集了一个新数据集,即 MIMIC-Diff-VQA,包含来自 164,324 对主图像与参考图像的 700,703 个问答对。与现有医学 VQA 数据集相比,我们的问题针对临床专业人员使用的评估-诊断-干预-评价治疗流程量身定制。同时,我们还提出了一种新颖的专家知识感知图表示学习模型来解决该任务。所提出的基线模型利用解剖结构先验、语义和空间知识等专家知识构建多关系图,表示两幅图像之间的图像差异以用于图像差异 VQA 任务。数据集与代码可在 https://github.com/Holipori/MIMIC-Diff-VQA 获取。我们相信该工作将进一步推动医学视觉-语言模型的发展。

关键词

引用

@article{arxiv.2307.11986,
  title  = {Expert Knowledge-Aware Image Difference Graph Representation Learning for Difference-Aware Medical Visual Question Answering},
  author = {Xinyue Hu and Lin Gu and Qiyuan An and Mengliang Zhang and Liangchen Liu and Kazuma Kobayashi and Tatsuya Harada and Ronald M. Summers and Yingying Zhu},
  journal= {arXiv preprint arXiv:2307.11986},
  year   = {2024}
}