基于LLaMA II的多模态医疗疾病分类
人工智能
2025-09-11 v1 计算机视觉与模式识别
摘要
医疗患者数据始终是多模态的。图像、文本、年龄、性别、组织病理数据仅是这一语境下不同模态的几个例子。在基于深度学习的方法中处理和集成这一多模态数据,因其巨大的潜力用于医疗程序(如诊断和患者治疗计划)而具有至关重要的意义。本文我们对基于变换模型的多模态疾病分类模型进行再训练。为此,我们使用来自OpenI的文本-图像对数据集,该数据集包含2D胸片片片段与临床报告相关联。我们的工作重点是融合方法,用于合并从医疗数据集中提取的文本和视觉信息。测试了不同具有LLaMA II背板模型的体系结构。模态特定特征的早期融合会产生更好的结果,最佳模型达到97.10%的平均AUC,而晚期融合(最佳模型:96.67%的平均AUC)则表现较差。两种方法都优于在同一多模态数据集上测试的以往分类模型。该新引入的多模态体系结构可以轻松应用于其他多模态数据集,并且可以轻易地适应进一步的研究,尤其是,但不限于,医疗AI领域。
引用
@article{arxiv.2412.01306,
title = {Multimodal Medical Disease Classification with LLaMA II},
author = {Christian Gapp and Elias Tappeiner and Martin Welk and Rainer Schubert},
journal= {arXiv preprint arXiv:2412.01306},
year = {2025}
}
备注
9 pages, 6 figures, conference: AIRoV -- The First Austrian Symposium on AI, Robotics, and Vision 25.-27.3.2024, Innsbruck