医学影像中保持一致性的视觉问答
计算机视觉与模式识别
2022-06-28 v1 机器学习
摘要
视觉问答(VQA)模型以图像和自然语言问题作为输入,推断问题的答案。近来,医学影像中的 VQA 系统因其在患者参与和临床医生第二意见等方面的潜在优势而受到关注。尽管大多数研究工作集中于改进架构和克服数据相关的局限,但答案一致性却被忽视,尽管它在建立可信模型方面起着关键作用。在本工作中,我们提出了一种新颖的损失函数及相应的训练流程,使得问题之间的关系能够纳入训练过程。具体而言,我们考虑感知问题与推理问题之间的蕴含关系已知先验的情况。为展示我们方法的优势,我们在眼底成像中糖尿病性黄斑水肿(DME)分期的临床相关任务上对其进行评估。我们的实验表明,我们的方法优于最先进的基线,不仅提升了模型一致性,也在整体模型准确率方面更优。我们的代码和数据可在 https://github.com/sergiotasconmorales/consistency_vqa 获取。
引用
@article{arxiv.2206.13296,
title = {Consistency-preserving Visual Question Answering in Medical Imaging},
author = {Sergio Tascon-Morales and Pablo Márquez-Neila and Raphael Sznitman},
journal= {arXiv preprint arXiv:2206.13296},
year = {2022}
}
备注
Appears in Medical Image Computing and Computer Assisted Interventions (MICCAI), 2022