面向医学差异视觉问答的位置感知预训练
计算机视觉与模式识别
2026-04-23 v2 人工智能
摘要
差异医学VQA模型需比较多个图像以识别临床意义的变化,依赖视觉编码器捕获反映放射科医生比较诊断工作流程的细粒度视觉差异。然而,基于标准对比或分类目标训练的视觉编码器往往难以捕获区分真实疾病进展与获取相关变异性所需的细微变化。为此,我们引入一种位置感知预训练框架,集成自动指代表达(AREF)、grounded captioning(GCAP)和条件自动指代表达(CAREF)。这些任务促进学习细粒度、空间锚定的视觉表示。当集成到语言模型后,我们的方法在医学差异VQA中实现了最先进的性能,准确识别和推理关于胸X射线图像中临床相关变化的细微差异。
引用
@article{arxiv.2603.04950,
title = {Location-Aware Pretraining for Medical Difference Visual Question Answering},
author = {Denis Musinguzi and Caren Han and Prasenjit Mitra},
journal= {arXiv preprint arXiv:2603.04950},
year = {2026}
}
备注
11 pages