MMDS:集成图像分析与基于部门的咨询的多模态医学诊断系统
计算机视觉与模式识别
2024-11-26 v2 人工智能
摘要
我们提出 MMDS,一个能够识别医学图像和患者面部细节并提供专业医学诊断的系统。该系统由两个核心组件组成:第一个组件是医学图像和视频的分析。我们训练了一个专门的多模态医学模型,能够解释医学图像并准确分析患者的面部情绪和面部瘫痪情况。该模型在 FER2013 人脸情绪识别数据集上达到 72.59% 的准确率,在识别“快乐”情绪方面达到 91.1% 的准确率。在面部瘫痪识别中,模型达到 92% 的准确率,这比 GPT-4o 高出 30%。基于该模型,我们开发了一个用于分析面部瘫痪患者面部运动视频的解析器,实现了对瘫痪严重程度的精确分级。在 30 部面部瘫痪患者视频的测试中,系统显示出 83.3% 的分级准确率。第二个组件是生成专业医学响应。我们采用大型语言模型,集成了医学知识库,通过分析医学图像或视频生成专业诊断。核心创新在于我们开发了基于部门的知识库路由管理机制,其中大型语言模型按医学部门对数据进行分类,并在检索过程中确定要查询的适当知识库。这显著提高了 RAG(检索增强生成)过程中检索的准确性。
引用
@article{arxiv.2410.15403,
title = {MMDS: A Multimodal Medical Diagnosis System Integrating Image Analysis and Knowledge-based Departmental Consultation},
author = {Yi Ren and HanZhi Zhang and Weibin Li and Jun Fu and Diandong Liu and Tianyi Zhang and Jie He and Licheng Jiao},
journal= {arXiv preprint arXiv:2410.15403},
year = {2024}
}