基于 VisionLLM 的多模态融合网络用于腔环生残细胞早期检测
计算机视觉与模式识别
2024-12-25 v1
摘要
腔环生残细胞早期检测对于改善患者预后至关重要,因为它可实现及时干预,保留声官功能,并显著降低肿瘤晚期风险和转移风险。然而,腔环生残细胞与声道功能紊乱的形态相似,导致检测准确率不佳。为此本文提出一种基于视觉大语言模型(VisionLLM)的多模态融合网络,用于腔环生残细胞检测,称为 MMGC-Net。通过整合图像和文本模态,多模态模型可捕获互补信息,从而实现更准确、更稳健的预测。在本文中,我们从中山大学附属第一医院收集了一个私人真实腔环生残细胞数据集,称为 SYSU1H,包含 5799 组图像-文本对。我们利用图像编码器和附加 Q-Former 提取视觉嵌入,并使用 Large Language Model Meta AI(Llama3)获取文本嵌入。这些模态随后通过咽部特征融合块集成,从而实现图像和文本特征的全面集成,提高了腔环生残细胞识别性能。在 SYSU1H 数据集上的大量实验表明,MMGC-Net 能实现最先进的性能,优于以往的多模态模型。
引用
@article{arxiv.2412.18124,
title = {VisionLLM-based Multimodal Fusion Network for Glottic Carcinoma Early Detection},
author = {Zhaohui Jin and Yi Shuai and Yongcheng Li and Lingcong Cai and Yun Li and Huifen Liu and Xiaomao Fan},
journal= {arXiv preprint arXiv:2412.18124},
year = {2024}
}