See-in-Pairs:基于参考图像引导的医学诊断比较型视觉语言模型
计算机视觉与模式识别
2026-02-24 v2
摘要
医学图像诊断具有挑战性,因为许多疾病与正常解剖结构相似且存在显著的患者间变异性。临床医生通常依赖比较诊断,例如借助跨患者的健康对照图像来识别细微但临床意义的异常。尽管健康参考图像在实践中丰富,但现有的医学视觉语言模型(VLM)主要在单张图像或单序列设置中工作,缺乏显式的比较诊断机制。本工作探讨了将临床动机的比较是否能增强VLM性能。我们表明,为VLMs提供查询图像和匹配的健康参考图像,并附带跨患者比较提示,可显著提高诊断性能。这种性能可以通过针对少量数据的轻量级监督微调(SFT)进一步提升。同时,我们评估了多种参考图像选择策略,包括随机采样、人口统计属性匹配、嵌入式检索和跨中心选择,发现所有设置都表现出一致的佳绩。最后,我们从理论上探讨了比较诊断为何有效,观察到样本效率的提高以及视觉与文本表征之间的更紧密对齐。我们的发现凸显了基于比较的诊断的临床相关性,提供了将参考图像纳入VLM的实用策略,并在多样化的医学影像任务中实现了性能提升。
引用
@article{arxiv.2506.18140,
title = {See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis},
author = {Ruinan Jin and Gexin Huang and Xinwei Shen and Qiong Zhang and Yan Shuo Tan and Xiaoxiao Li},
journal= {arXiv preprint arXiv:2506.18140},
year = {2026}
}
备注
25 pages, four figures