中文

M3T:多模态医学Transformer,弥合临床上下文与视觉洞察以生成视网膜图像医学描述

计算机视觉与模式识别 2024-12-24 v1 机器学习

摘要

自动视网膜图像医学描述生成对于简化医学诊断和治疗规划至关重要。现有的挑战包括依赖学习的视网膜图像表示、处理多种成像模态的困难以及视觉表示中缺乏临床上下文。为了解决这些问题,我们提出了多模态医学Transformer(M3T),这是一种新颖的深度学习架构,它将视觉表示与诊断关键词整合在一起。与以往专注于特定方面的研究不同,我们的方法有效地从两种模态中学习上下文信息和语义,从而能够为视网膜图像生成精确且连贯的医学描述。在 DeepEyeNet 数据集上的实验研究验证了 M3T 在满足眼科医生标准方面的成功,表明其在 BLEU@4 指标上比最佳基线模型提高了 13.5%。

关键词

引用

@article{arxiv.2406.13129,
  title  = {M3T: Multi-Modal Medical Transformer to bridge Clinical Context with Visual Insights for Retinal Image Medical Description Generation},
  author = {Nagur Shareef Shaik and Teja Krishna Cherukuri and Dong Hye Ye},
  journal= {arXiv preprint arXiv:2406.13129},
  year   = {2024}
}

备注

This paper has been accepted for presentation at the IEEE International Conference on Image Processing (ICIP 2024)