中文

面向临床可解释性的视网膜 VQA 研究:基于空间锚定的皮肤病灶证据

计算机视觉与模式识别 2026-05-22 v1 人工智能

摘要

视觉问答 (VQA) 在临床支持方面具有巨大的潜力,尤其是在眼科学中,视网膜 fundus 照相对于诊断至关重要。然而,眼科 VQA 基准主要强调答案准确率,忽略了临床可解释性所需的明确视觉证据。本文引入FundusGround,一个面向临床可解释性的眼科 VQA 基准,包含空间锚定的皮肤病灶证据。具体而言,我们提出了一个三阶段流程,收集10,719幅 fundus 图像并对15,595个图像级严格标注的皮肤病灶进行注释。为确保解剖一致性和临床有效性,所有皮肤病灶均使用早期治疗糖尿病视网膜病变研究委员会 (ETDRS) 网格进行空间定位,以实现标准化映射到九个临床意义明确的视网膜区域。基于这一结构化的皮肤病灶证据,我们生成了72,706个问题,涵盖四种格式:开放式、封闭式、单选和多选。我们进一步对多种通用和医学大型视觉语言模型进行基准测试,使用双重指标评估答案准确率和病灶级别推理。实验结果表明,融合病灶级别的视觉证据在模型性能和透明度方面均显著提升,凸显了空间锚定对于可靠和可解释眼科 VQA 的必要性。

关键词

引用

@article{arxiv.2605.22414,
  title  = {Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence},
  author = {Xingyue Wang and Bo Liu and Meng Wang and Zhixuan Zhang and Chengcheng Zhu and Huazhu Fu and Jiang Liu},
  journal= {arXiv preprint arXiv:2605.22414},
  year   = {2026}
}