中文

DREAM:基于自适应多模态融合的动态视网膜增强技术用于专家级精准医学报告生成

计算机视觉与模式识别 2026-04-21 v1 人工智能 信号处理

摘要

自动化视网膜图像的医学报告需要视觉模式识别与深厚临床知识的复杂融合。当前的大型视觉语言模型(LVLM)在数据稀缺的专业医学领域常常表现不佳,导致模型过拟合并遗漏细微但关键的病理特征。为了解决这个问题,我们引入了DREAM(动态视网膜增强与自适应多模态融合),这是一个新颖的高保真医学报告生成框架,即使在数据有限的情况下也能表现出色。DREAM采用了一种独特的两阶段融合机制,能够智能地将视觉数据与眼科医生整理的临床关键词整合起来。首先,Abstractor模块将图像和关键词特征映射到一个共享空间,用病理相关的见解增强视觉数据。接着,Adaptor执行自适应多模态融合,使用可学习参数动态加权每种模态的重要性,以创建统一的表示。为了确保模型的输出在语义上基于临床现实,一个对比对齐模块在训练期间将这些融合表示与真实医学报告对齐。通过将医学专业知识与高效的融合策略相结合,DREAM在DeepEyeNet基准测试上设立了新的最先进水平,取得了0.241的BLEU-4分数,并进一步在ROCO数据集上展示了强大的泛化能力。

关键词

引用

@article{arxiv.2604.17209,
  title  = {DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation},
  author = {Nagur Shareef Shaik and Teja Krishna Cherukuri and Dong Hye Ye},
  journal= {arXiv preprint arXiv:2604.17209},
  year   = {2026}
}

备注

Accepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026