中文

通过跨模态特征对齐实现深度融合的上下文感知视网膜底图分类

计算机视觉与模式识别 2025-09-29 v1 人工智能

摘要

本研究旨在通过集成细粒度图像特征和全局文本上下文,开发一种新型多模态深度学习架构,以提高从视网膜底图进行疾病分类的准确性。现有多模态大语言模型(MLLM)往往难以捕获诊断青光眼、糖尿病性视网膜病变和视网膜色素病等眼科疾病所必需的低层次空间细节。本模型开发与验证研究是在1305个视网膜底图-文本对上进行的,这些数据来自三个公共数据集(FIVES、HRF和StoneRounds),涵盖了获得性和遗传性视网膜疾病,并使用分类准确率和F1分数进行评估。MDF-MLLM将四个U-Net编码器层的跳过特征整合到LLaMA 3.2 11B MLLM中的跨注意力块中。视觉特征通过patch级投影,并使用缩放跨注意力和FiLM-based U-Net调制进行融合。基线MLLM在双类型疾病分类任务上达到60%的准确率。MDF-MLLM在训练过程中对U-Net和MLLM组件进行完全微调,达到了显著更高的94%准确率,实现了56%的提升。召回率和F1分数分别比基线提高了最高可达67%和35%。消融研究确认,多深度融合方法对空间推理和分类具有显著贡献,尤其对于具有丰富临床文本的遗传性疾病效果尤为突出。MDF-MLLM提供了一种通用、可解释且模块化的视网膜底图分类框架,凭借多尺度特征融合显著优于传统MLLM基线。该架构为临床决策支持系统的实际部署展现了前景。未来工作将探索同步训练技术、更大范围的疾病以提高通用性,并将模型扩展用于分割任务。

关键词

引用

@article{arxiv.2509.21358,
  title  = {MDF-MLLM: Deep Fusion Through Cross-Modal Feature Alignment for Contextually Aware Fundoscopic Image Classification},
  author = {Jason Jordan and Mohammadreza Akbari Lor and Peter Koulen and Mei-Ling Shyu and Shu-Ching Chen},
  journal= {arXiv preprint arXiv:2509.21358},
  year   = {2025}
}

备注

Word count: 5157, Table count: 2, Figure count: 5