合成血管结构与病理增强视觉语言模型推理
计算机视觉与模式识别
2025-12-15 v1
摘要
视觉语言模型通过允许用户在预测和跨不同模态之间询问临床解释,为实现可解释的医学诊断提供了一条有前景的路径。然而,训练VLM进行详细推理需要大规模的图像-文本数据集。在许多专业领域,例如在阅读光学相干断层扫描血管成像(OCTA)图像时,这种带有病理基础描述的精确文本非常稀缺甚至不存在。为克服这一瓶颈,我们引入了合成血管推理(SVR),这是一个可控制地合成图像和相应文本的框架,具体包括:具有糖尿病视网膜病变(DR)特征的真实视网膜血管系统:毛细血管缺失、微动脉瘤、新生血管和扭曲,同时自动生成细粒度推理文本。基于此,我们构建了OCTA-100K-SVR,一个包含100,000对数据的OCTA图像-推理数据集。我们的实验表明,在该数据集上训练的通用VLM(Qwen3-VL-8b)在真实OCTA图像上实现了89.67%的零样本平衡分类准确率,优于监督基线。通过人类专家评估,我们还证明它显著增强了临床数据上的解释质量和病理定位能力。
引用
@article{arxiv.2512.11060,
title = {Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning},
author = {Chenjun Li and Cheng Wan and Laurin Lux and Alexander Berger and Richard B. Rosen and Martin J. Menten and Johannes C. Paetzold},
journal= {arXiv preprint arXiv:2512.11060},
year = {2025}
}
备注
23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)