通过深度专家注入锚定视网膜视觉语言模型:域特定知识
计算机视觉与模式识别
2026-03-20 v3 人工智能
摘要
大型视觉语言模型(LVLMs)显示出巨大的潜力用于自动化眼科诊断。然而,其临床部署严重受限于缺乏专业知识。在本工作中,我们确定了两种结构性缺陷限制可靠医学推理:1) 感知差距,通用视觉编码器无法解决细粒度病理线索(如微动脌瘤);2) 推理差距,稀疏的视觉证据在更深的变换层中被大量语言先验所取代,导致无 grounding 的幻觉。为弥合这些差距,我们提出了EyExIn,通过深度专家注入机制将视网膜VLMs锚定在专家知识之上。我们的体系结构采用专家感知双流编码策略,将视觉表示分离为用于解剖背景的通用流和用于病理语义的专业专家流。为确保高保真集成,我们设计了语义自适应门控融合模块,动态放大细微病灶信号同时过滤无关背景噪声。此外,我们引入自适应深度专家注入,通过将融合视觉特征作为残差偏置直接整合到中间LLM层,以实现持久的"视觉锚点"。该机制创建了视觉捷径,迫使推理堆栈严格依赖于视觉证据。广泛的实验在四个基准上表明,我们的模型持续优于大型专有系统。EyExIn显著增强了域特定知识嵌入,在眼科视觉问答中实现了最先进的精度,推动了可信赖的眼科AI发展。
引用
@article{arxiv.2603.07131,
title = {Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge},
author = {Shuai Lu and Meng Wang and Jia Guo and Jiawei Du and Bo Liu and Shengzhu Yang and Weihang Zhang and Huazhu Fu and Huiqi Li},
journal= {arXiv preprint arXiv:2603.07131},
year = {2026}
}