中文

GCS-M3VLT:基于引导上下文自注意力的多模态医学视觉语言 Transformer 用于视网膜图像描述生成

计算机视觉与模式识别 2024-12-24 v1 机器学习 图像与视频处理

摘要

视网膜图像分析是诊断和治疗眼部疾病的关键任务,但由于图像质量和病理变化的多样性,尤其在标注数据有限的情况下,生成准确的医学报告仍然具有挑战性。以往基于 Transformer 的模型在受限监督下难以整合视觉和文本信息。为此,本文提出一种新的视觉语言模型,用于视网膜图像描述生成,通过引导上下文自注意力机制整合视觉和文本特征。该方法即使在数据稀缺场景下也能捕捉细微细节和全局临床背景。在 DeepEyeNet 数据集上的大量实验表明,我们的方法实现了 0.023 的 BLEU@4 提升,同时在定性方面取得了显著的进展,凸显了该模型在生成全面医学描述方面的有效性。

关键词

引用

@article{arxiv.2412.17251,
  title  = {GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning},
  author = {Teja Krishna Cherukuri and Nagur Shareef Shaik and Jyostna Devi Bodapati and Dong Hye Ye},
  journal= {arXiv preprint arXiv:2412.17251},
  year   = {2024}
}

备注

This paper has been accepted for presentation at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)